Back

Knowledge-guided Bayesian optimization using pre-trained LLMs speeds up the identification of superior genotypes from germplasm collection

Hamazaki, K.; Tsuda, K.

2026-07-02 bioinformatics
10.64898/2026.06.28.735149 bioRxiv
Show abstract

Background: Germplasm collections contain wide genetic diversity that is valuable for plant breeding, but conducting phenotypic evaluation for all genotypes in field trials is rarely feasible. Bayesian optimization offers a way to decide, season by season, which genotypes to cultivate in order to identify superior genotypes with fewer evaluations. However, standard Bayesian optimization commonly starts from randomly selected genotypes and mainly relies on surrogate models built from marker genotype information, while the text-based passport information that accompanies germplasm is not fully used. We examined whether pre-trained large language models can provide prior knowledge that improves these decisions in germplasm evaluation. Results: We constructed a large-language-model-guided Bayesian optimization framework that introduces large language models into two parts of the Bayesian optimization workflow. In zero-shot warmstarting, a large language model proposes initial genotypes using passport information such as cultivar name, country of origin, and subpopulation, optionally together with principal component scores derived from genome-wide single-nucleotide-polymorphism markers. In addition, we evaluated a large-language-model-based surrogate model that predicts phenotypic values for untested genotypes using in-context learning from previously evaluated genotypes. Using a rice germplasm panel and two target traits (seed number per panicle for maximization and protein content for minimization), we compared strategies. For seed number per panicle, zero-shot warmstarting with a general-purpose instruction-following model reduced the number of evaluated genotypes needed to reach the best genotype, whereas improvements were small for protein content. When genomic information was available, Gaussian-process-based Bayesian optimization was the strongest overall approach, while the large-language-model-based surrogate model outperformed random baselines and was competitive in some settings. When genomic information was not available, predictions based on passport information improved efficiency compared with fully random strategies. Conclusions: Pre-trained large language models can inject useful agronomic knowledge into Bayesian optimization for germplasm evaluation, particularly by improving early-stage genotype selection, and can also support optimization when genomic information is unavailable. As models better handle long genomic sequences together with passport information, large-language-model-guided Bayesian optimization may become a practical and explainable decision-support approach for agricultural optimization.

Matching journals

The top 4 journals account for 50% of the predicted probability mass.

1
Theoretical and Applied Genetics
49 papers in training set
Top 0.1%
18.6%
2
The Plant Genome
57 papers in training set
Top 0.1%
18.6%
3
in silico Plants
27 papers in training set
Top 0.1%
9.0%
4
PLOS ONE
5266 papers in training set
Top 26%
6.3%
50% of probability mass above
5
Frontiers in Plant Science
256 papers in training set
Top 1%
5.5%
6
Horticulture Research
47 papers in training set
Top 0.2%
4.3%
7
New Phytologist
346 papers in training set
Top 3%
3.2%
8
Plant Phenomics
18 papers in training set
Top 0.1%
3.2%
9
Plant Methods
42 papers in training set
Top 0.3%
2.4%
10
The Plant Phenome Journal
14 papers in training set
Top 0.1%
2.1%
11
Scientific Reports
3612 papers in training set
Top 47%
2.1%
12
PLOS Computational Biology
1863 papers in training set
Top 14%
1.7%
13
BMC Plant Biology
57 papers in training set
Top 0.9%
1.5%
14
GigaScience
212 papers in training set
Top 3%
1.5%
15
Plant Direct
95 papers in training set
Top 2%
1.4%
16
Plant Physiology
238 papers in training set
Top 2%
1.4%
17
Evolutionary Applications
108 papers in training set
Top 1.0%
1.3%
18
Applications in Plant Sciences
23 papers in training set
Top 0.3%
1.1%
19
BMC Genomics
406 papers in training set
Top 7%
1.0%
20
Briefings in Bioinformatics
354 papers in training set
Top 7%
0.6%
21
The Plant Journal
215 papers in training set
Top 3%
0.6%
22
Journal of Experimental Botany
219 papers in training set
Top 3%
0.6%
23
Crop Science
18 papers in training set
Top 0.4%
0.6%