Back

Does ensembling improve feature attributions from sequence-to-activity models?

Maslova, A.; Libbrecht, M.

2026-07-13 bioinformatics
10.64898/2026.07.08.737315 bioRxiv
Show abstract

Sequence-to-activity models take as input DNA sequence and predict genomic activities such as transcription factor binding and gene expression. Applying explainable AI (xAI) methods such as DeepLIFT to these models has recently led to breakthroughs towards many genomic problems, including transcription factor binding grammar and predicting effects of genetic variants. However, there remains significant uncertainty about the reliability of sequence-to-activity interpretations. Thus, we need accurate probabilistic measures of confidence to distinguish reliable from unreliable interpretations. Towards this end, researchers have recently aimed to characterize variability across ensembles of S2A models. However, previous work has focused on using model ensembles to improve the model predictions themselves. Here, we aim to evaluate whether model ensembles can also be used to improve feature attributions from post-hoc xAI methods. We find that ensembling attributions from multiple models improves downstream applications, including identifying transcription factor motifs and predicting regulatory genetic variants. We show that forming an ensemble using Monte Carlo Dropout (MCDropout) gets near to, but does not match, the performance of training multiple models, at much less train-time computational cost.

Matching journals

The top 7 journals account for 50% of the predicted probability mass.

1
Bioinformatics
1204 papers in training set
Top 1%
18.4%
2
PLOS Computational Biology
1863 papers in training set
Top 5%
7.3%
3
Genome Biology
637 papers in training set
Top 2%
6.2%
4
Cell Systems
201 papers in training set
Top 0.8%
5.5%
5
Genome Research
468 papers in training set
Top 1%
5.5%
6
Nucleic Acids Research
1281 papers in training set
Top 4%
5.1%
7
BMC Bioinformatics
457 papers in training set
Top 2%
4.8%
50% of probability mass above
8
Bioinformatics Advances
203 papers in training set
Top 1%
4.8%
9
NAR Genomics and Bioinformatics
242 papers in training set
Top 1%
4.0%
10
Nature Communications
5641 papers in training set
Top 32%
4.0%
11
Journal of Computational Biology
48 papers in training set
Top 0.3%
3.4%
12
Computational and Structural Biotechnology Journal
242 papers in training set
Top 2%
3.2%
13
Briefings in Bioinformatics
354 papers in training set
Top 3%
2.8%
14
Frontiers in Genetics
230 papers in training set
Top 2%
2.1%
15
BMC Genomics
406 papers in training set
Top 4%
1.9%
16
Scientific Reports
3612 papers in training set
Top 56%
1.7%
17
BioData Mining
22 papers in training set
Top 0.3%
1.5%
18
GENETICS
483 papers in training set
Top 3%
1.3%
19
Proceedings of the National Academy of Sciences
2444 papers in training set
Top 37%
1.1%
20
Nature Machine Intelligence
70 papers in training set
Top 2%
0.8%
21
Human Genetics and Genomics Advances
84 papers in training set
Top 2%
0.8%
22
eLife
5828 papers in training set
Top 65%
0.8%
23
Molecular Biology and Evolution
542 papers in training set
Top 5%
0.6%