Back

Beyond natural amino acids: Extending immunogenicity risk assessment to non-canonical peptide drugs through chemical feature encoding

Cairoli, M.; Nielsen, M.; Betts, C.; Obrezanova, O.; De Maria, L.

2026-05-26 bioinformatics
10.64898/2026.05.22.727138 bioRxiv
Show abstract

Peptide therapeutics are increasingly used to treat challenging diseases, but immunogenicity risks limit their clinical success. In silico tools enable immunogenicity screening through prediction of peptide-MHCII binding, yet current methods fail to capture chemical properties of non-natural amino acids routinely incorporated to improve drug properties. Here, we present a machine learning approach combining chemical fingerprints with sequence information to predict MHC class II binding for both canonical and modified peptides. We propose two molecular representations (direct-encoding and similarity-based chemical fingerprints) that preserve positional information while encoding chemical diversity. These representations achieved performance comparable to sequence-based encodings (BLOSUM62 and one-hot) for canonical peptides while accurately identifying binding cores and motifs. Testing on citrullinated peptides, chemical fingerprints substantially improved quantitative prediction accuracy while maintaining comparable linear correlation across encoding methods, demonstrating the importance of explicit chemical representation for accurate absolute binding affinity prediction. These descriptors can be integrated into pan-allele prediction frameworks, enabling immunogenicity risk assessment across diverse modifications and therapeutic modalities, including peptide therapeutics, antibody-drug conjugates, and synthetic vaccines. The proposed chemistry-informed framework addresses a critical gap in preclinical drug development, facilitating early mitigation strategies before costly clinical trials.

Matching journals

The top 3 journals account for 50% of the predicted probability mass.

1
mAbs
32 papers in training set
Top 0.1%
30.7%
2
Journal of Chemical Information and Modeling
238 papers in training set
Top 0.5%
11.8%
3
Briefings in Bioinformatics
354 papers in training set
Top 0.5%
10.5%
50% of probability mass above
4
Scientific Reports
3612 papers in training set
Top 27%
4.0%
5
Journal of Chemical Theory and Computation
140 papers in training set
Top 0.5%
3.2%
6
Nature Communications
5641 papers in training set
Top 36%
3.2%
7
Molecular Therapy Nucleic Acids
39 papers in training set
Top 0.3%
2.7%
8
PLOS Computational Biology
1863 papers in training set
Top 12%
2.4%
9
Computational and Structural Biotechnology Journal
242 papers in training set
Top 2%
2.4%
10
PLOS ONE
5266 papers in training set
Top 43%
2.4%
11
Bioinformatics
1204 papers in training set
Top 7%
1.7%
12
Advanced Science
286 papers in training set
Top 5%
1.7%
13
Nature Machine Intelligence
70 papers in training set
Top 1%
1.7%
14
Journal of Medicinal Chemistry
77 papers in training set
Top 0.6%
1.5%
15
Frontiers in Immunology
638 papers in training set
Top 7%
1.3%
16
Cell Reports Methods
165 papers in training set
Top 3%
1.1%
17
ImmunoInformatics
12 papers in training set
Top 0.1%
1.1%
18
Communications Chemistry
48 papers in training set
Top 1%
1.0%
19
Bioinformatics Advances
203 papers in training set
Top 4%
0.8%
20
Communications Biology
993 papers in training set
Top 31%
0.8%
21
ACS Omega
105 papers in training set
Top 4%
0.8%
22
iScience
1154 papers in training set
Top 40%
0.6%
23
Proceedings of the National Academy of Sciences
2444 papers in training set
Top 45%
0.6%