Back

Simulating Tandem Mass Spectra for Small Molecules using a General-Purpose Large-Language Model

Nguyen, T.; Barupal, D.

2025-11-11 bioinformatics
10.1101/2025.11.10.687298 bioRxiv
Show abstract

We show a practical application of the Google Gemini large-language-model for simulating tandem mass spectra for compounds from the Blood Exposome Database. This approach bypasses the need for domain-specific model training, suggesting that the chemical fragmentation knowledge could be latently encoded within the Gemini model. General-purpose LLMs represent a useful and accessible tool for expanding in-silico spectral libraries and may accelerate the compound annotation in mass spectrometry-based metabolomics and exposomics.

Matching journals

The top 4 journals account for 50% of the predicted probability mass.

1
Journal of the American Society for Mass Spectrometry
37 papers in training set
Top 0.1%
18.6%
2
Analytical Chemistry
218 papers in training set
Top 0.2%
18.6%
3
Journal of Proteome Research
234 papers in training set
Top 0.3%
12.5%
4
Bioinformatics
1204 papers in training set
Top 4%
5.6%
50% of probability mass above
5
Metabolites
53 papers in training set
Top 0.2%
4.1%
6
Nature Communications
5641 papers in training set
Top 34%
3.4%
7
Scientific Data
209 papers in training set
Top 1%
2.4%
8
Journal of Chemical Information and Modeling
238 papers in training set
Top 1%
2.4%
9
Chemical Science
73 papers in training set
Top 0.7%
2.1%
10
Communications Chemistry
48 papers in training set
Top 0.5%
1.9%
11
Nature Machine Intelligence
70 papers in training set
Top 1%
1.7%
12
Journal of Cheminformatics
29 papers in training set
Top 0.4%
1.7%
13
Computational and Structural Biotechnology Journal
242 papers in training set
Top 3%
1.7%
14
iScience
1154 papers in training set
Top 18%
1.7%
15
Briefings in Bioinformatics
354 papers in training set
Top 5%
1.5%
16
PLOS Computational Biology
1863 papers in training set
Top 15%
1.5%
17
Scientific Reports
3612 papers in training set
Top 62%
1.3%
18
BMC Bioinformatics
457 papers in training set
Top 5%
1.1%
19
Patterns
78 papers in training set
Top 2%
1.0%
20
Nature Protocols
33 papers in training set
Top 0.5%
0.8%
21
PLOS ONE
5266 papers in training set
Top 61%
0.8%
22
Bioinformatics Advances
203 papers in training set
Top 4%
0.8%
23
ACS Omega
105 papers in training set
Top 3%
0.8%
24
Nature Biotechnology
172 papers in training set
Top 5%
0.6%
25
Nature Methods
385 papers in training set
Top 7%
0.6%
26
GigaScience
212 papers in training set
Top 5%
0.6%