Back

Exploring diverse routes to high-affinity-antibody variable domains through deep-sequencing-informed machine learning

Kawada, S.; Ito, T.; Nakazawa, H.; Kurumida, Y.; Saito, Y.; Umetsu, M.

2026-06-01 bioengineering
10.64898/2026.05.28.728451 bioRxiv
Show abstract

The integration of in vitro selection, deep sequencing, and machine learning (ML) has recently been developed as a powerful strategy for discovering functional antibodies. However, how training data composition and ML search space design influence the identification of high-affinity variants remains unclear. Here, we aimed to optimize ML-integrated directed evolution for functional antibody discovery by selecting training data from deep sequencing analysis. By performing phage display selection using camelid heavy-chain antibodies (VHHs), we demonstrated that early-round data, retaining more binding-negative variants, can be superior for training models to identify high-performance VHHs. We also investigated a lead-independent ML search space design by focusing on conserved residues in final rounds, successfully identifying variants with higher affinities than those from lead-based maturation (KD = 7.9 nM). These findings demonstrate that training data selection and search space design are critical for successful ML-guided antibody engineering and provide diverse pathways for discovering high-affinity VHH variants.

Matching journals

The top 10 journals account for 50% of the predicted probability mass.

1
eLife
5828 papers in training set
Top 11%
9.5%
2
Nature Communications
5641 papers in training set
Top 26%
6.1%
3
Cell Systems
201 papers in training set
Top 0.7%
6.1%
4
PLOS Computational Biology
1863 papers in training set
Top 7%
5.4%
5
Science Advances
1243 papers in training set
Top 5%
5.3%
6
Proceedings of the National Academy of Sciences
2444 papers in training set
Top 11%
4.7%
7
Cell Reports
1498 papers in training set
Top 9%
4.2%
8
mAbs
32 papers in training set
Top 0.2%
3.9%
9
Communications Biology
993 papers in training set
Top 4%
3.9%
10
Advanced Science
286 papers in training set
Top 2%
3.4%
50% of probability mass above
11
Scientific Reports
3612 papers in training set
Top 37%
3.1%
12
Cell Discovery
57 papers in training set
Top 0.3%
3.0%
13
Cell Chemical Biology
94 papers in training set
Top 0.5%
2.7%
14
Computational and Structural Biotechnology Journal
242 papers in training set
Top 2%
2.4%
15
Journal of Chemical Information and Modeling
238 papers in training set
Top 2%
2.1%
16
Journal of the American Chemical Society
217 papers in training set
Top 2%
1.8%
17
Protein Science
246 papers in training set
Top 2%
1.7%
18
ACS Chemical Biology
167 papers in training set
Top 2%
1.7%
19
ACS Synthetic Biology
287 papers in training set
Top 2%
1.3%
20
iScience
1154 papers in training set
Top 23%
1.3%
21
Briefings in Bioinformatics
354 papers in training set
Top 6%
1.1%
22
Angewandte Chemie International Edition
93 papers in training set
Top 1%
1.1%
23
Applied and Environmental Microbiology
339 papers in training set
Top 4%
1.1%
24
Science China Life Sciences
29 papers in training set
Top 0.4%
1.1%
25
PLOS ONE
5266 papers in training set
Top 58%
1.0%
26
Molecular Therapy
81 papers in training set
Top 2%
1.0%
27
Genomics, Proteomics & Bioinformatics
16 papers in training set
Top 0.1%
1.0%
28
BMC Genomics
406 papers in training set
Top 7%
1.0%
29
Nucleic Acids Research
1281 papers in training set
Top 13%
1.0%
30
International Journal of Molecular Sciences
494 papers in training set
Top 13%
1.0%