Back

DNAGPT: A Generalized Pre-trained Tool for Versatile DNA Sequence Analysis Tasks

Zhang, D.; Zhang, w.; Zhao, Y.; Zhang, J.; He, B.; Qin, C.; Yao, J.

2023-08-31 genomics
10.1101/2023.07.11.548628 bioRxiv
Show abstract

Pre-trained large language models demonstrate potential in extracting information from DNA sequences, yet adapting to a variety of tasks and data modalities remains a challenge. To address this, we propose DNAGPT, a generalized DNA pre-training model trained on over 200 billion base pairs from all mammals. By enhancing the classic GPT model with a binary classification task (DNA sequence order), a numerical regression task (guanine-cytosine content prediction), and a comprehensive token language, DNAGPT can handle versatile DNA analysis tasks while processing both sequence and numerical data. Our evaluation of genomic signal and region recognition, mRNA abundance regression, and artificial genome generation tasks demonstrates DNAGPTs superior performance compared to existing models designed for specific downstream tasks, benefiting from pre-training using the newly designed model structure.

Matching journals

The top 5 journals account for 50% of the predicted probability mass.

1
Bioinformatics
1204 papers in training set
Top 2%
12.9%
2
IEEE Transactions on Computational Biology and Bioinformatics
20 papers in training set
Top 0.1%
11.9%
3
Briefings in Bioinformatics
354 papers in training set
Top 0.6%
9.8%
4
Genome Research
468 papers in training set
Top 0.4%
9.6%
5
Genome Biology
637 papers in training set
Top 1%
7.9%
50% of probability mass above
6
Nature Communications
5641 papers in training set
Top 27%
5.5%
7
Nature Computational Science
55 papers in training set
Top 0.1%
4.8%
8
PLOS Computational Biology
1863 papers in training set
Top 8%
4.3%
9
Nature Machine Intelligence
70 papers in training set
Top 0.6%
4.3%
10
Bioinformatics Advances
203 papers in training set
Top 2%
2.4%
11
Frontiers in Genetics
230 papers in training set
Top 2%
2.1%
12
Scientific Reports
3612 papers in training set
Top 54%
1.7%
13
Genomics, Proteomics & Bioinformatics
172 papers in training set
Top 1%
1.7%
14
BMC Bioinformatics
457 papers in training set
Top 4%
1.7%
15
NAR Genomics and Bioinformatics
242 papers in training set
Top 3%
1.7%
16
Nucleic Acids Research
1281 papers in training set
Top 11%
1.1%
17
Computational and Structural Biotechnology Journal
242 papers in training set
Top 5%
1.1%
18
GigaScience
212 papers in training set
Top 3%
1.1%
19
iScience
1154 papers in training set
Top 29%
1.1%
20
BMC Genomics
406 papers in training set
Top 8%
0.8%
21
Journal of Genetics and Genomics
38 papers in training set
Top 0.7%
0.8%
22
Journal of Computational Biology
48 papers in training set
Top 1%
0.6%