Back

DDTRN: Predicting Bacterial Transcriptional Regulatory Networks Based on Gene Sequences using Dual Descriptor

Nie, P.; Ma, B.-G.

2026-07-01 bioinformatics
10.64898/2026.06.30.735580 bioRxiv
Show abstract

Accurate computational reconstruction of bacterial transcriptional regulatory network (TRN) from sequence information alone remains a fundamental challenge in systems biology, particularly for non-model organisms lacking extensive transcriptomic data. We present DDTRN, a sequence-driven framework that formulates TRN inference as a binary classification task over concatenated regulator-target gene sequence pairs and employs a Dual Descriptor (DD) model to predict regulatory interactions. The DD architecture represents a sequence into two learnable components: Composition Weight Map (CWM) and Position Weight Function (PWF). We comprehensively evaluate DDTRN against six conventional machine learning baselines across eight benchmark bacterial datasets, including E. coli (DREAM5, RegulonDB), B. subtilis, S. enterica, C. glutamicum, M. tuberculosis, P. aeruginosa, and S. coelicolor. DDTRN achieves superior overall performance, attaining average AUROC and AUPR scores of 0.869 and 0.868, respectively, with particularly pronounced advantages at lower descriptor ranks where positional weighting compensates for limited sequence context. Systematic sensitivity analyses of rank, embedding dimension, and basis function count reveal stable optimal operating regimes, while subsampling experiments demonstrate strong robustness even with limited training data. Interpretability analyses show that PWF learns distinct periodic contributions across different rank granularities and that CWM preferentially weights meaningful k-mers. A case study on E. coli dataset further illustrates that DDTRN identifies method-specific candidate targets complementary to those proposed by conventional approaches. By operating solely on genomic sequence, DDTRN provides a scalable, interpretable, and data-efficient framework for bacterial TRN inference in species where expression data are scarce, and it establishes a foundation for future multimodal integration with condition-specific regulatory information.

Matching journals

The top 5 journals account for 50% of the predicted probability mass.

1
Bioinformatics
1204 papers in training set
Top 2%
14.8%
2
Briefings in Bioinformatics
354 papers in training set
Top 0.4%
12.5%
3
NAR Genomics and Bioinformatics
242 papers in training set
Top 0.1%
12.3%
4
PLOS Computational Biology
1863 papers in training set
Top 5%
6.6%
5
Nature Communications
5641 papers in training set
Top 28%
5.4%
50% of probability mass above
6
Bioinformatics Advances
203 papers in training set
Top 1%
4.3%
7
Journal of Computational Biology
48 papers in training set
Top 0.2%
4.3%
8
Nucleic Acids Research
1281 papers in training set
Top 5%
4.0%
9
Nature Machine Intelligence
70 papers in training set
Top 0.9%
3.2%
10
BMC Bioinformatics
457 papers in training set
Top 3%
3.1%
11
Scientific Reports
3612 papers in training set
Top 43%
2.4%
12
BMC Genomics
406 papers in training set
Top 3%
2.4%
13
npj Systems Biology and Applications
125 papers in training set
Top 0.7%
2.4%
14
Cell Systems
201 papers in training set
Top 2%
1.9%
15
Journal of Chemical Information and Modeling
238 papers in training set
Top 2%
1.7%
16
New Phytologist
346 papers in training set
Top 4%
1.3%
17
Computational and Structural Biotechnology Journal
242 papers in training set
Top 5%
1.1%
18
Genome Biology
637 papers in training set
Top 7%
1.0%
19
Proceedings of the National Academy of Sciences
2444 papers in training set
Top 39%
1.0%
20
mSystems
394 papers in training set
Top 6%
0.8%
21
Frontiers in Microbiology
427 papers in training set
Top 8%
0.8%
22
Frontiers in Genetics
230 papers in training set
Top 6%
0.8%
23
PLOS ONE
5266 papers in training set
Top 65%
0.6%
24
Genome Research
468 papers in training set
Top 7%
0.6%
25
Frontiers in Bioinformatics
49 papers in training set
Top 2%
0.6%
26
eLife
5828 papers in training set
Top 69%
0.6%