Back

RD-OMICS: An Integrative Multi-Omics Data Inventory in Rare Diseases

Sun, S.; Wang, H.; Mathe, E. A.; Zhu, Q.

2026-07-03 bioinformatics
10.64898/2026.06.29.735296 bioRxiv
Show abstract

Rare diseases (RD) impact over 30 million individuals in the United States, yet fewer than 5% of the identified conditions have FDA-approved treatments. Progress in RD research is hindered by small patient cohorts, biological heterogeneity, and the fragmented, inconsistently annotated publicly available omics data, which limits integrative analysis and translational discovery. Here, we present RD-OMICS, a data inventory with integrated and structured RD omics data from Gene Expression Omnibus (GEO), in the form of a knowledge graph. We developed a metadata harmonization pipeline that combines rule-based mapping and large language model (LLM)-assisted semantic categorization. The graph-based data model was defined to integrate different types of data including disease conditions, experiments, samples, platforms, projects, and publications into a centralized inventory graph. In this preliminary study, 11,049 GEO series for 126 rare diseases were processed and integrated into RD-OMICS, which includes 375,930 individual biospecimen samples, 1,578 sequencing and array platforms, 10,938 biological projects. Case studies demonstrate the use of RD-OMICS in supporting rare disease research, omics cohort construction, and transcriptome-based drug repurposing for amyotrophic lateral sclerosis (ALS). RD-OMICS provides a scalable foundation for transforming fragmented omics data into a structured, harmonized and interoperable resource, facilitating therapeutic development and other translational discoveries in rare diseases.

Matching journals

The top 2 journals account for 50% of the predicted probability mass.

1
Scientific Data
209 papers in training set
Top 0.1%
45.9%
2
Database
61 papers in training set
Top 0.1%
8.9%
50% of probability mass above
3
NAR Genomics and Bioinformatics
242 papers in training set
Top 0.5%
6.3%
4
PLOS ONE
5266 papers in training set
Top 32%
4.4%
5
Scientific Reports
3612 papers in training set
Top 33%
3.2%
6
Bioinformatics
1204 papers in training set
Top 6%
2.4%
7
Nucleic Acids Research
1281 papers in training set
Top 8%
2.1%
8
The American Journal of Human Genetics
234 papers in training set
Top 2%
1.7%
9
Nature Communications
5641 papers in training set
Top 45%
1.7%
10
Genetics in Medicine
78 papers in training set
Top 0.6%
1.7%
11
Genome Medicine
183 papers in training set
Top 3%
1.4%
12
Computational and Structural Biotechnology Journal
242 papers in training set
Top 5%
1.1%
13
Orphanet Journal of Rare Diseases
21 papers in training set
Top 0.4%
1.1%
14
GigaScience
212 papers in training set
Top 3%
1.1%
15
Genomics, Proteomics & Bioinformatics
172 papers in training set
Top 1%
1.1%
16
Bioinformatics Advances
203 papers in training set
Top 4%
1.1%
17
BMC Bioinformatics
457 papers in training set
Top 5%
1.1%
18
Genome Research
468 papers in training set
Top 6%
1.0%
19
BioData Mining
22 papers in training set
Top 0.8%
0.8%
20
Frontiers in Genetics
230 papers in training set
Top 7%
0.6%
21
European Journal of Human Genetics
58 papers in training set
Top 1%
0.6%
22
Neuron
337 papers in training set
Top 5%
0.6%
23
Human Mutation
34 papers in training set
Top 0.6%
0.6%
24
Briefings in Bioinformatics
354 papers in training set
Top 8%
0.6%
25
PLOS Computational Biology
1863 papers in training set
Top 21%
0.6%
26
Artificial Intelligence in the Life Sciences
13 papers in training set
Top 0.4%
0.6%
27
GENETICS
483 papers in training set
Top 5%
0.6%
28
Journal of Translational Medicine
57 papers in training set
Top 3%
0.6%