Back

trAIt: Species-by-Trait Data Retrieval using Large Language Models

Balaji, S.; Martinson, K. A.; Schellenberger, J. S.; Koley, J.; Inman, C. M.; Hofmann, H. A.; Young, R. L.; Harpak, A.

2026-06-24 bioinformatics
10.64898/2026.06.19.732660 bioRxiv
Show abstract

Biological research often requires information about species traits. Manual literature collation can be time-consuming and miss parts of the literature. To address this gap, we developed trAIt, a publicly available software for the retrieval of characteristics of species from scientific literature catalogued in the Europe PubMed Central (PubMed) database. trAIt provides a graphical user interface (GUI) in which users specify species and characteristics of interest. Leveraging a large language model (LLM), trAIt retrieves relevant papers, combines their content through a consensus-based summarization model, and outputs a species-by-characteristic table. For a case study involving frog species, trAIt recovered 47.1% of trait-species combinations in 2.75 hours, while an expert curator independently recovered 62.4% over months. The consensus-based summarization substantially aids accuracy compared to single-source extraction. Across three case studies of vertebrate taxa, an expert confirmed the accuracy of 70.9% of trait-species entries recovered by trAIt. We observed considerable variation across taxa in trAIts accuracy, which is possibly due to heterogeneity in open-access literature availability and inconsistencies in species and trait terminology. In sum, our analysis suggests that LLM-based tools can accelerate biological data synthesis but should be used to support domain experts research, rather than replace their judgment.

Matching journals

The top 5 journals account for 50% of the predicted probability mass.

1
GigaScience
212 papers in training set
Top 0.1%
13.0%
2
Scientific Data
209 papers in training set
Top 0.2%
12.6%
3
PLOS ONE
5266 papers in training set
Top 19%
9.8%
4
BMC Bioinformatics
457 papers in training set
Top 0.8%
9.0%
5
Database
61 papers in training set
Top 0.1%
6.8%
50% of probability mass above
6
PeerJ
308 papers in training set
Top 0.6%
6.3%
7
Bioinformatics
1204 papers in training set
Top 4%
5.5%
8
Applications in Plant Sciences
23 papers in training set
Top 0.1%
3.3%
9
PLOS Biology
486 papers in training set
Top 3%
2.1%
10
Scientific Reports
3612 papers in training set
Top 50%
1.9%
11
Briefings in Bioinformatics
354 papers in training set
Top 4%
1.9%
12
BMC Biology
265 papers in training set
Top 2%
1.7%
13
Nucleic Acids Research
1281 papers in training set
Top 9%
1.7%
14
Systematic Entomology
14 papers in training set
Top 0.2%
1.3%
15
NAR Genomics and Bioinformatics
242 papers in training set
Top 3%
1.1%
16
Computational and Structural Biotechnology Journal
242 papers in training set
Top 5%
1.1%
17
eLife
5828 papers in training set
Top 57%
1.1%
18
BMC Genomics
406 papers in training set
Top 6%
1.1%
19
Frontiers in Bioinformatics
49 papers in training set
Top 1%
1.0%
20
BioData Mining
22 papers in training set
Top 0.7%
0.9%
21
Genome Biology and Evolution
338 papers in training set
Top 3%
0.9%
22
Peer Community Journal
281 papers in training set
Top 5%
0.9%
23
Ecological Informatics
33 papers in training set
Top 0.8%
0.6%
24
Methods in Ecology and Evolution
176 papers in training set
Top 2%
0.6%
25
Bioinformatics Advances
203 papers in training set
Top 5%
0.6%