Back

A unified data infrastructure to support large-scale rare disease research

Johansson, L. F.; Laurie, S.; Spalding, D.; Gibson, S.; Ruvolo, D.; Thomas, C.; Piscia, D.; de Andrade, F.; Been, G.; Bijlsma, M.; Brunner, H.; Cimerman, S.; Yavari Dizjikan, F.; Ellwanger, K.; Fernandez, M.; Freeberg, M.; van de Geijn, G.-J.; Kanninga, R.; Maddi, V.; Medtarizadeh, M.; Neerincx, P.; Ossowski, S.; Rath, A.; Roelofs-Prins, D.; Stok-Benjamins, M.; van der Velde, K. J.; Veal, C.; van der Vries, G.; Wadsley, M.; Warren, G.; Zurek, B.; Keane, T.; Graessner, H.; Solve-RD, ; Beltran, S.; Swertz, M. A.; Brookes, A. J.

2023-12-20 genetic and genomic medicine
10.1101/2023.12.20.23299950 medRxiv
Show abstract

The Solve-RD project brings together clinicians, scientists, and patient representatives from 51 institutes spanning 15 countries to collaborate on genetically diagnosing ("solving") rare diseases (RDs). The project aims to significantly increase the diagnostic success rate by co-analysing data from thousands of RD cases, including phenotypes, pedigrees, exome/genome sequencing and multi-omics data. Here we report on the data infrastructure devised and created to support this co-analysis. This infrastructure enables users to store, find, connect, and analyse data and metadata in a collaborative manner. Pseudonymised phenotypic and raw experimental data are submitted to the RD-Connect Genome-Phenome Analysis Platform and processed through standardised pipelines. Resulting files and novel produced omics data are sent to the European Genome-phenome Archive, which adds unique file identifiers and provides long-term storage and controlled access services. MOLGENIS "RD3" and Cafe Variome "Discovery Nexus" connect data and metadata and offer discovery services, and secure cloud-based "Sandboxes" support multi-party data analysis. This proven infrastructure design provides a blueprint for other projects that need to analyse large amounts of heterogeneous data.

Matching journals

The top 6 journals account for 50% of the predicted probability mass.

1
Nucleic Acids Research
1281 papers in training set
Top 1%
14.4%
2
Bioinformatics
1204 papers in training set
Top 2%
11.4%
3
GigaScience
212 papers in training set
Top 0.1%
11.4%
4
Genome Biology
637 papers in training set
Top 2%
6.0%
5
International Journal of Molecular Sciences
494 papers in training set
Top 1%
5.2%
6
NAR Genomics and Bioinformatics
242 papers in training set
Top 0.8%
5.2%
50% of probability mass above
7
Nature Communications
5641 papers in training set
Top 30%
4.6%
8
BMC Bioinformatics
457 papers in training set
Top 2%
4.1%
9
Bioinformatics Advances
203 papers in training set
Top 2%
3.9%
10
Data in Brief
14 papers in training set
Top 0.1%
3.1%
11
Genome Medicine
183 papers in training set
Top 2%
3.0%
12
Nature Computational Science
55 papers in training set
Top 0.4%
2.3%
13
Database
61 papers in training set
Top 0.4%
2.0%
14
PLOS ONE
5266 papers in training set
Top 50%
1.7%
15
Frontiers in Genetics
230 papers in training set
Top 3%
1.7%
16
Computational and Structural Biotechnology Journal
242 papers in training set
Top 4%
1.3%
17
Scientific Data
209 papers in training set
Top 2%
1.3%
18
BMC Genomics
406 papers in training set
Top 7%
1.1%
19
Human Mutation
34 papers in training set
Top 0.4%
1.1%
20
PLOS Computational Biology
1863 papers in training set
Top 19%
0.9%
21
Artificial Intelligence in the Life Sciences
13 papers in training set
Top 0.2%
0.9%
22
Genes
144 papers in training set
Top 4%
0.9%
23
Scientific Reports
3612 papers in training set
Top 77%
0.8%
24
Genome Research
468 papers in training set
Top 7%
0.8%
25
BMC Medical Genomics
50 papers in training set
Top 1%
0.8%
26
Briefings in Bioinformatics
354 papers in training set
Top 8%
0.6%
27
eLife
5828 papers in training set
Top 70%
0.6%
28
PLOS Genetics
862 papers in training set
Top 14%
0.6%
29
Life Science Alliance
285 papers in training set
Top 10%
0.6%