Back

MARiO: predicting cancer variant pathogenicity by integrating in silico evaluation and patient-level mutational contexts

Nakagawa, H.; Kamatani, T.; Ishibashi, N.; Aoyama, S.; Morioka, M.; Miya, F.; Ikeda, S.

2026-07-10 bioinformatics
10.64898/2026.07.07.736919 bioRxiv
Show abstract

Comprehensive genomic profiling (CGP) supports precision medicine in cancer care, but accurate assessment of missense variant pathogenicity, especially for variants without established consensus, remains challenging. Various computational tools have been developed for variant functional prediction, but most current tools rely solely on variant-level features and do not capture the clinical context of individual patients. To address this limitation, we developed MARiO (Missense Alteration Risk for Oncogenicity), a machine-learning model that integrates variant-level features and patient-level clinical and genomic contexts to effectively predict the pathogenicity of missense variants in cancer. We collected a total of 10,642 missense variants from 1271 patients, and evaluated candidate features for their association with variant pathogenicity, identifying informative features including in silico functional predictions, population allele frequency, variant allele frequency, and tumor mutational burden. Using these selected features, MARiO was developed with extreme gradient boosting. The model integrates multiple in silico prediction tools and patient-specific genomic contexts while accommodating missing values frequently observed in real-world CGP datasets. MARiO outperformed existing tools, achieving an area under the receiver operating characteristic curve of 0.942. The model demonstrated strong generalizability across multiple external datasets and showed consistency with real-world molecular treatment proposals. MARiO offers a robust and clinically relevant approach for missense variant pathogenicity assessment by integrating variant- and patient-level features and serves as a valuable tool to support clinical decision-making.

Matching journals

The top 9 journals account for 50% of the predicted probability mass.

1
Cancer Research
130 papers in training set
Top 0.2%
7.9%
2
Genome Medicine
183 papers in training set
Top 0.2%
7.9%
3
Nature Communications
5641 papers in training set
Top 22%
7.3%
4
Bioinformatics
1204 papers in training set
Top 3%
6.8%
5
JCO Clinical Cancer Informatics
22 papers in training set
Top 0.1%
6.8%
6
Briefings in Bioinformatics
354 papers in training set
Top 2%
4.9%
7
npj Precision Oncology
53 papers in training set
Top 0.4%
3.3%
8
BMC Bioinformatics
457 papers in training set
Top 3%
3.3%
9
Communications Medicine
113 papers in training set
Top 1.0%
3.3%
50% of probability mass above
10
PLOS Computational Biology
1863 papers in training set
Top 10%
3.2%
11
PLOS ONE
5266 papers in training set
Top 41%
2.7%
12
Genetics in Medicine
78 papers in training set
Top 0.5%
2.5%
13
BMC Medical Genomics
50 papers in training set
Top 0.4%
1.9%
14
Scientific Reports
3612 papers in training set
Top 50%
1.9%
15
The American Journal of Human Genetics
234 papers in training set
Top 2%
1.7%
16
Human Genetics and Genomics Advances
84 papers in training set
Top 1%
1.7%
17
npj Systems Biology and Applications
125 papers in training set
Top 1%
1.5%
18
npj Genomic Medicine
36 papers in training set
Top 0.4%
1.4%
19
Bioinformatics Advances
203 papers in training set
Top 3%
1.3%
20
BioData Mining
22 papers in training set
Top 0.5%
1.1%
21
Genome Biology
637 papers in training set
Top 7%
1.1%
22
IEEE Transactions on Computational Biology and Bioinformatics
20 papers in training set
Top 0.5%
1.0%
23
Cell Reports Medicine
153 papers in training set
Top 4%
0.9%
24
Cell Reports Methods
165 papers in training set
Top 4%
0.9%
25
Cell Systems
201 papers in training set
Top 5%
0.6%
26
IEEE/ACM Transactions on Computational Biology and Bioinformatics
38 papers in training set
Top 1%
0.6%
27
Genomics, Proteomics & Bioinformatics
16 papers in training set
Top 0.2%
0.6%
28
Cancers
213 papers in training set
Top 5%
0.6%
29
Nucleic Acids Research
1281 papers in training set
Top 15%
0.6%
30
NAR Genomics and Bioinformatics
242 papers in training set
Top 5%
0.6%