Back

MycoCirc: A Pan-Fungal Multi-Modal Pretrained Model for Fungal circRNA Prediction from Genome Sequence

Hu, X.; Jin, Y.; Wang, J.; Yang, E.

2026-07-03 bioinformatics
10.64898/2026.06.29.735431 bioRxiv
Show abstract

Motivation: Exploring the fungal circular RNA (circRNA) landscape is bottlenecked by both experimental and computational limits. While standard mRNA-seq systematically discards circRNAs due to their lack of poly(A) tails, high-cost total RNA-seq remains prohibitive for large-scale screening. Consequently, discovery relies heavily on computational prediction. However, existing models trained exclusively on human or plant sequences fail in fungi because of the extreme genomic divergence across fungal lineages, which span from intron-poor Candida to intron-rich filamentous fungi. As a result, no computational framework currently exists for de novo fungal circRNA prediction, leaving the vast majority of non-model fungi entirely inaccessible. Results: We present mycoCirc, the first end-to-end pan-fungal multi-modal pretrained model for fungal circRNA prediction, integrating three mandatory modalities with bidirectional cross-attention for donor-acceptor site interaction. Pre-trained on 22 strains with 16,483 positive gene-circRNA associations spanning Ascomycete yeast, Basidiomycete yeast, and Filamentous fungi groups and fine-tuned per group using 5-fold cross-validation, mycoCirc achieved AUROC 0.69-0.70 on held-out test species under Mode A (Genome+GTF, no RNA-seq), substantially outperforming JEDI (0.51-0.57) and CircPCBL (0.49-0.53). Cross-species evaluation on four independent fungi datasets demonstrated robust generalization across all fine-tuned variants (AUROC 0.63-0.72). Beyond gene-level classification, the JunctionEncoder module enabled backsplicing junction identification for detailed circRNA validation. We further build mycoCircAtlas, a companion database providing 319,860 high-confidence gene-circRNA predictions across 768 fungal species from Ensembl Fungi Release 113, enabling researchers to query precomputed predictions and design validation primers without local model deployment.

Matching journals

The top 6 journals account for 50% of the predicted probability mass.

1
Nucleic Acids Research
1281 papers in training set
Top 1%
12.4%
2
Nature Methods
385 papers in training set
Top 0.8%
11.7%
3
Nature Communications
5641 papers in training set
Top 21%
7.7%
4
Cell Reports Methods
165 papers in training set
Top 0.2%
6.6%
5
Genome Biology
637 papers in training set
Top 2%
6.6%
6
Nature Biotechnology
172 papers in training set
Top 0.7%
5.4%
50% of probability mass above
7
Advanced Science
286 papers in training set
Top 1%
4.8%
8
Nature Machine Intelligence
70 papers in training set
Top 0.7%
4.0%
9
Briefings in Bioinformatics
354 papers in training set
Top 3%
3.2%
10
New Phytologist
346 papers in training set
Top 3%
3.2%
11
Bioinformatics Advances
203 papers in training set
Top 2%
3.2%
12
Genome Research
468 papers in training set
Top 3%
2.4%
13
BMC Bioinformatics
457 papers in training set
Top 4%
2.1%
14
Bioinformatics
1204 papers in training set
Top 6%
2.1%
15
Scientific Reports
3612 papers in training set
Top 59%
1.5%
16
eLife
5828 papers in training set
Top 55%
1.3%
17
PLOS Computational Biology
1863 papers in training set
Top 16%
1.3%
18
NAR Genomics and Bioinformatics
242 papers in training set
Top 4%
1.1%
19
Computational and Structural Biotechnology Journal
242 papers in training set
Top 5%
1.1%
20
Proceedings of the National Academy of Sciences
2444 papers in training set
Top 36%
1.1%
21
BMC Genomics
406 papers in training set
Top 6%
1.1%
22
Communications Biology
993 papers in training set
Top 26%
1.0%
23
Cell Systems
201 papers in training set
Top 4%
1.0%
24
iScience
1154 papers in training set
Top 41%
0.6%
25
Science Advances
1243 papers in training set
Top 34%
0.6%