Back

RUDEUS, a machine learning classification system to study DNA-Binding proteins

Medina-Ortiz, D.; Cabas-Mora, G.; Moya-Barria, I.; Soto-Garcia, N.; Uribe-Paredes, R.

2024-02-21 bioinformatics
10.1101/2024.02.19.580825 bioRxiv
Show abstract

DNA-binding proteins are essential in different biological processes, including DNA replication, transcription, packaging, and chromatin remodelling. Exploring their characteristics and functions has become relevant in diverse scientific domains. Computational biology and bioinformatics have assisted in studying DNA-binding proteins, complementing traditional molecular biology methods. While recent advances in machine learning have enabled the integration of predictive systems with bioinformatic approaches, there still needs to be generalizable pipelines for identifying unknown proteins as DNA-binding and assessing the specific type of DNA strand they recognize. In this work, we introduce RUDEUS, a Python library featuring hierarchical classification models designed to identify DNA-binding proteins and assess the specific interaction type, whether single-stranded or double-stranded. RUDEUS has a versatile pipeline capable of training predictive models, synergizing protein language models with supervised learning algorithms, and integrating Bayesian optimization strategies. The trained models have high performance, achieving a precision rate of 95% for DNA-binding identification and 89% for discerning between single-stranded and doublestranded interactions. RUDEUS includes an exploration tool for evaluating unknown protein sequences, annotating them as DNA-binding, and determining the type of DNA strand they recognize. Moreover, a structural bioinformatic pipeline has been integrated into RUDEUS for validating the identified DNA strand through DNA-protein molecular docking. These comprehensive strategies and straightforward implementation demonstrate comparable performance to high-end models and enhance usability for integration into protein engineering pipelines.

Matching journals

The top 5 journals account for 50% of the predicted probability mass.

1
Bioinformatics
1204 papers in training set
Top 2%
15.2%
2
Briefings in Bioinformatics
354 papers in training set
Top 0.2%
15.2%
3
Bioinformatics Advances
203 papers in training set
Top 0.5%
7.3%
4
Computational Biology and Chemistry
28 papers in training set
Top 0.1%
7.3%
5
Computational and Structural Biotechnology Journal
242 papers in training set
Top 0.3%
6.8%
50% of probability mass above
6
BMC Bioinformatics
457 papers in training set
Top 2%
4.9%
7
Computers in Biology and Medicine
128 papers in training set
Top 0.9%
4.1%
8
International Journal of Molecular Sciences
494 papers in training set
Top 3%
3.5%
9
Nucleic Acids Research
1281 papers in training set
Top 6%
2.8%
10
Frontiers in Bioinformatics
49 papers in training set
Top 0.2%
2.7%
11
NAR Genomics and Bioinformatics
242 papers in training set
Top 2%
2.5%
12
Scientific Reports
3612 papers in training set
Top 50%
1.9%
13
PLOS Computational Biology
1863 papers in training set
Top 16%
1.4%
14
Journal of Cheminformatics
29 papers in training set
Top 0.5%
1.1%
15
Frontiers in Molecular Biosciences
102 papers in training set
Top 1%
1.1%
16
Biosystems
31 papers in training set
Top 0.5%
1.0%
17
International Journal of Biological Macromolecules
76 papers in training set
Top 2%
1.0%
18
PLOS ONE
5266 papers in training set
Top 59%
1.0%
19
Journal of Chemical Information and Modeling
238 papers in training set
Top 2%
0.9%
20
PeerJ
308 papers in training set
Top 11%
0.9%
21
Frontiers in Genetics
230 papers in training set
Top 6%
0.6%
22
Journal of Molecular Biology
232 papers in training set
Top 4%
0.6%
23
Database
61 papers in training set
Top 1%
0.6%
24
Protein Science
246 papers in training set
Top 4%
0.6%
25
GigaScience
212 papers in training set
Top 5%
0.6%