Back

AI-based separation of malignant cell- and microenvironment-specific gene expression from bulk RNA sequencing enhances biomarker interpretation

Zolotar, A.; Wiebe, D.; Petrosyants, A.; Shpak, B.; Khotkina, N.; Beliaeva, V.; Ivleva, E.; Balabanian, L.; Chelushkin, M.; Dyikanov, D.; Savchenko, M.; Yong, S. T.; Litvinov, D.; Zotova, A.; Kuznetsov, A.; Zaitsev, A.; Sharun, A.; Kosmin, A.; Nomie, K.; Abdou, M.; Sarachakov, A.; Bagaev, A.

2026-04-30 cancer biology
10.64898/2026.04.28.721082 bioRxiv
Show abstract

Bulk RNA sequencing (RNA-seq)-based gene expression analysis is a promising tool for personalized cancer diagnostics, disease monitoring, and treatment decision-making. However, its clinical utility is limited by interference from non-malignant tumor microenvironment cells, which can dominate transcript data in low-purity tumors. While cell deconvolution methods like Kassandra can predict digital cell percentages from bulk RNA-seq, approaches for delineating the gene expression contribution of tumor compartments remain limited. To overcome this limitation, we developed Helenus, a machine-learning-based tool that separates gene expression between malignant and non-malignant cells. Trained on over 200 million synthetic RNA profiles representing diverse tumor types and purities, Helenus demonstrated high accuracy in separating gene expression origin. Helenus also uncovered true genomic-RNA correlations such as copy number alterations and the expression of therapeutic antibody-drug conjugate targets specifically on tumor cells. Helenus provides critical insights into tumor biology and immunotherapy response by precisely identifying biomarker expressions, paving the way for more effective personalized cancer care. SignificanceHelenus extracts gene expression profiles of cancerous and non-cancerous compartments of tumor biopsies from bulk RNA-seq data, enabling the determination of how the expression of specific genes affects malignancy and tumor immunity.

Matching journals

The top 8 journals account for 50% of the predicted probability mass.

1
npj Precision Oncology
53 papers in training set
Top 0.1%
11.8%
2
Nature Communications
5641 papers in training set
Top 17%
10.9%
3
Cancer Research Communications
51 papers in training set
Top 0.1%
7.2%
4
Genome Medicine
183 papers in training set
Top 0.5%
6.2%
5
Cell Reports Methods
165 papers in training set
Top 0.4%
4.3%
6
Genome Biology
637 papers in training set
Top 3%
4.3%
7
Cancer Cell
42 papers in training set
Top 0.3%
4.0%
8
Cancer Research
130 papers in training set
Top 1%
2.8%
50% of probability mass above
9
Scientific Reports
3612 papers in training set
Top 38%
2.8%
10
Science Advances
1243 papers in training set
Top 13%
2.6%
11
Cell Reports
1498 papers in training set
Top 17%
2.1%
12
npj Systems Biology and Applications
125 papers in training set
Top 0.8%
2.1%
13
Communications Medicine
113 papers in training set
Top 2%
2.1%
14
Cell Reports Medicine
153 papers in training set
Top 2%
2.1%
15
Clinical Cancer Research
64 papers in training set
Top 1%
1.9%
16
Nucleic Acids Research
1281 papers in training set
Top 9%
1.7%
17
Patterns
78 papers in training set
Top 2%
1.5%
18
Cancers
213 papers in training set
Top 3%
1.3%
19
PLOS Computational Biology
1863 papers in training set
Top 16%
1.3%
20
Nature Methods
385 papers in training set
Top 5%
1.1%
21
Nature Biotechnology
172 papers in training set
Top 4%
1.1%
22
Nature Cancer
39 papers in training set
Top 1%
1.1%
23
Science Translational Medicine
127 papers in training set
Top 3%
1.0%
24
Cancer Discovery
66 papers in training set
Top 2%
1.0%
25
Proceedings of the National Academy of Sciences
2444 papers in training set
Top 39%
1.0%
26
Molecular Cancer
16 papers in training set
Top 0.3%
1.0%
27
eLife
5828 papers in training set
Top 62%
1.0%
28
NAR Cancer
37 papers in training set
Top 0.7%
0.8%
29
PLOS ONE
5266 papers in training set
Top 62%
0.8%
30
Modern Pathology
22 papers in training set
Top 0.4%
0.8%