Back

PHI-Reason: evidence-grounded species-level phage-host prediction from structured biological text profiles

Zhang, Y.-z.; Xu, L.; Imoto, S.

2026-06-12 bioinformatics
10.64898/2026.06.10.727770 bioRxiv
Show abstract

Phage-host interaction (PHI) prediction is a fundamental problem in microbiology. Existing approaches typically encode phage and host information as numerical representations derived from sequence similarity, protein content or reference databases, and use them to score candidate hosts or train prediction models. Although effective, this design obscures which biological evidence supports a prediction. Here, we present PHI-Reason, a species-level PHI prediction framework that reformulates host prediction as inference over structured biological text. PHI-Reason converts heterogeneous genomic, functional and contextual evidence into modular natural-language profiles, which a frozen large language model integrates at inference time for candidate-host ranking or pairwise PHI assessment. Across species-level benchmarks, PHI-Reason achieved competitive performance and complementary correct assignments relative to established methods. Its explicit profile design enables evidence perturbation and rationale-grounding analyses, making prediction support and hallucination risk operationally measurable. PHI-Reason provides an interpretable evidence-integration approach and demonstrates how large language models can support evidence-grounded PHI prediction.

Matching journals

The top 8 journals account for 50% of the predicted probability mass.

1
Cell Systems
201 papers in training set
Top 0.1%
18.7%
2
Genome Biology
637 papers in training set
Top 2%
6.8%
3
PLOS Computational Biology
1863 papers in training set
Top 6%
6.3%
4
Nucleic Acids Research
1281 papers in training set
Top 3%
5.6%
5
Nature Biotechnology
172 papers in training set
Top 0.8%
4.9%
6
Nature Communications
5641 papers in training set
Top 32%
4.1%
7
Nature Methods
385 papers in training set
Top 3%
3.3%
8
Nature Microbiology
155 papers in training set
Top 1.0%
3.3%
50% of probability mass above
9
Proceedings of the National Academy of Sciences
2444 papers in training set
Top 16%
3.3%
10
NAR Genomics and Bioinformatics
242 papers in training set
Top 2%
2.8%
11
Bioinformatics
1204 papers in training set
Top 6%
2.8%
12
Science
477 papers in training set
Top 4%
1.9%
13
mSystems
394 papers in training set
Top 4%
1.7%
14
Briefings in Bioinformatics
354 papers in training set
Top 5%
1.5%
15
Scientific Reports
3612 papers in training set
Top 58%
1.5%
16
Molecular Biology and Evolution
542 papers in training set
Top 4%
1.3%
17
Advanced Science
286 papers in training set
Top 7%
1.1%
18
Nature Machine Intelligence
70 papers in training set
Top 2%
1.1%
19
BMC Bioinformatics
457 papers in training set
Top 5%
1.1%
20
New Phytologist
346 papers in training set
Top 4%
1.1%
21
Genome Research
468 papers in training set
Top 5%
1.0%
22
eLife
5828 papers in training set
Top 60%
1.0%
23
Journal of Chemical Information and Modeling
238 papers in training set
Top 2%
1.0%
24
Science Advances
1243 papers in training set
Top 27%
1.0%
25
PLOS ONE
5266 papers in training set
Top 59%
1.0%
26
Nature Ecology & Evolution
18 papers in training set
Top 0.3%
0.9%
27
Nature
645 papers in training set
Top 10%
0.9%
28
Virus Evolution
155 papers in training set
Top 1%
0.9%
29
npj Antimicrobials and Resistance
11 papers in training set
Top 0.2%
0.9%
30
BMC Genomics
406 papers in training set
Top 8%
0.9%