Back

MegaKG: Toward an explainable knowledge graph for early drug development

Dong, J.; Liu, J.; Wei, Y.; Huang, P.; Wu, Q.

2024-03-30 bioinformatics
10.1101/2024.03.27.586981 bioRxiv
Show abstract

In biomedical research, the utilization of Knowledge Graph (KG) has proven valuable in gaining deep understanding of various processes. In this study, we constructed a comprehensive biomedical KG, named as MegaKG, by integrating a total of 23 primary data sources, which finally consisted of 188, 844 nodes/entities and 9, 165, 855 edges/relations after stringent data processing. Such a massive KG can not only provide a holistic view of the entities of interest, but also generate insightful hypotheses on unknown relations by applying AI computations. We focused on the interplay of the key elements in drug development, such as genes, diseases and drugs, and aimed to facilitate practical applications that could benefit early drug development in industries. More importantly, we placed much emphasis on the exploitability of the predictions generated by MegaKG. This may greatly help researchers to assess the feasibility or design appropriate downstream validation experiments, making AI techniques more than just black-box models. In this regard, NBFNet was adopted, which combines the advantages of both traditional path-based methods and more recently developed GNN-based ones. Performance evaluation experiments indicated superior results by MegaKG. We also conducted real case studies to validate its practical utility in various scenarios, including target prediction, indication extension and drug repurposing. All these experiments highlighted the potential of MegaKG as a valuable tool in driving innovation and accelerating drug development in pharmaceutical industry.

Matching journals

The top 7 journals account for 50% of the predicted probability mass.

1
IEEE Transactions on Computational Biology and Bioinformatics
20 papers in training set
Top 0.1%
11.6%
2
IEEE/ACM Transactions on Computational Biology and Bioinformatics
38 papers in training set
Top 0.1%
11.6%
3
Briefings in Bioinformatics
354 papers in training set
Top 1%
6.6%
4
Bioinformatics
1204 papers in training set
Top 4%
6.1%
5
Journal of Biomedical Informatics
47 papers in training set
Top 0.3%
5.4%
6
Bioinformatics Advances
203 papers in training set
Top 1%
4.7%
7
IEEE Journal of Biomedical and Health Informatics
37 papers in training set
Top 0.2%
4.2%
50% of probability mass above
8
PLOS ONE
5266 papers in training set
Top 33%
4.2%
9
Computational and Structural Biotechnology Journal
242 papers in training set
Top 1%
3.9%
10
Genomics, Proteomics & Bioinformatics
172 papers in training set
Top 0.7%
3.1%
11
BMC Bioinformatics
457 papers in training set
Top 3%
2.7%
12
Journal of Computational Biology
48 papers in training set
Top 0.4%
2.7%
13
Computers in Biology and Medicine
128 papers in training set
Top 2%
2.6%
14
GigaScience
212 papers in training set
Top 2%
2.4%
15
Artificial Intelligence in Medicine
17 papers in training set
Top 0.3%
2.1%
16
BMC Medical Informatics and Decision Making
43 papers in training set
Top 0.9%
2.1%
17
Scientific Reports
3612 papers in training set
Top 51%
1.9%
18
PLOS Computational Biology
1863 papers in training set
Top 15%
1.7%
19
IEEE Access
35 papers in training set
Top 0.7%
1.7%
20
Expert Systems with Applications
11 papers in training set
Top 0.2%
1.3%
21
Database
61 papers in training set
Top 0.7%
1.1%
22
iScience
1154 papers in training set
Top 27%
1.1%
23
Frontiers in Genetics
230 papers in training set
Top 5%
1.0%
24
Journal of the American Medical Informatics Association
71 papers in training set
Top 2%
1.0%
25
Patterns
78 papers in training set
Top 2%
1.0%
26
Journal of Cheminformatics
29 papers in training set
Top 0.7%
0.8%
27
BioData Mining
22 papers in training set
Top 1%
0.6%