Back

Simulation-based Bayesian deep learning enables uncertainty-aware tumor fraction estimation in cell-free DNA

Volkov, H.; Raitses-Gurevich, M.; Grad, M.; Shlayem, R.; Danilevsky, A.; Rubinek, T.; Gorfine, M.; Shomron, N.

2026-06-19 bioinformatics
10.64898/2026.06.15.732265 bioRxiv
Show abstract

BackgroundEstimating tumor fraction from whole-genome cell-free DNA sequencing is critical for liquid biopsy, but is hampered by weak signals and baseline noise at low tumor fractions. Existing computational methods often require matched controls or large labeled datasets for training and lack uncertainty quantification. To address these gaps, we developed purNPE, a Bayesian deep-learning framework trained without labeled cancer cell-free DNA samples. Specifically, purNPE leverages a two-part generative model: one component simulates diverse tumor copy-number profiles based on evolutionary genealogies, while a second, data-driven component learns and replicates realistic sequencing background patterns from cancer-free cell-free DNA. By training a Neural Posterior Estimator on synthetic tumor profiles augmented with learned noise, purNPE performs amortized inference in milliseconds without needing a reference sample set at inference. ResultsIn a real-world pan-cancer cohort, purNPE achieved comparable performance with existing methods against orthogonal mutant-allele-fraction validation (MAE = 0.066). In silico and semi-synthetic experiments suggested analytical sensitivity around 1% tumor fraction under the evaluated conditions and showed strong classification accuracy in low tumor fractions (AUC = 0.98 for TF[≤] 3% versus controls). ConclusionsThis work provides a framework for using simulation-based inference to derive calibrated, uncertainty-aware TF estimates, offering a potential alternative to traditional data-dependent methods.

Matching journals

The top 5 journals account for 50% of the predicted probability mass.

1
Bioinformatics
1204 papers in training set
Top 0.7%
26.5%
2
Briefings in Bioinformatics
354 papers in training set
Top 0.9%
7.8%
3
GigaScience
212 papers in training set
Top 0.4%
6.7%
4
PLOS Computational Biology
1863 papers in training set
Top 6%
5.5%
5
BMC Genomics
406 papers in training set
Top 1%
5.5%
50% of probability mass above
6
NAR Genomics and Bioinformatics
242 papers in training set
Top 0.8%
4.8%
7
Nature Communications
5641 papers in training set
Top 31%
4.3%
8
Genome Biology
637 papers in training set
Top 3%
4.3%
9
BMC Bioinformatics
457 papers in training set
Top 2%
4.0%
10
Scientific Reports
3612 papers in training set
Top 42%
2.4%
11
Genome Medicine
183 papers in training set
Top 2%
2.1%
12
Forensic Science International: Genetics
26 papers in training set
Top 0.1%
1.7%
13
Computational and Structural Biotechnology Journal
242 papers in training set
Top 3%
1.7%
14
Nucleic Acids Research
1281 papers in training set
Top 10%
1.3%
15
BioData Mining
22 papers in training set
Top 0.4%
1.3%
16
Cell Reports Methods
165 papers in training set
Top 3%
1.1%
17
Bioinformatics Advances
203 papers in training set
Top 4%
1.1%
18
PLOS ONE
5266 papers in training set
Top 57%
1.1%
19
JCO Clinical Cancer Informatics
22 papers in training set
Top 0.6%
1.1%
20
BMC Medical Genomics
50 papers in training set
Top 1%
0.8%
21
Advanced Science
286 papers in training set
Top 11%
0.6%
22
Nature Biotechnology
172 papers in training set
Top 5%
0.6%
23
Journal of Computational Biology
48 papers in training set
Top 1%
0.6%