Back

A Systematic Approach Toward Implementing Machine Learning Techniques to Analyze Gut Microbiome Data

Jahanikia, S.; Taada, A.; George, A.; Biruduraju, D.; Lu, E.; Singh, I.; Chhajer, K.; Wang, M.; Pentela, T.

2026-04-26 bioinformatics
10.64898/2026.04.22.720178 bioRxiv
Show abstract

This study investigates the relationship between the gut microbiota and specific diseases. Data was collected from the Human Gut Microbiome Atlas, which examines regional variations across 20 countries on five continents, categorizing microbial species by taxonomy, from genus to species. The Atlas provides color-coded phylum classifications, numerical species counts within the same genus, and an analysis of dysbiosis-related associations with 23 diseases, as well as region-enriched species. The data stratified samples into distinct categories such as westernized, non-westernized, cancerous, and non-cancerous. The findings demonstrate that tree-based ensemble methods, such as Bagging and Boosting prediction methods, achieved the highest accuracies across all categories due to their robustness in handling the complex, high-dimensional data. The XGBoost model yielded the strongest predictive performance, achieving 91% accuracy for westernized cancer-associated samples, 84% accuracy for non-westernized cancer-associated samples, 92% accuracy for westernized samples, and 78% for non-westernized samples. Additionally, advanced topological data analysis was used to assess the global structure and underlying patterns within the dataset. ImportanceThis research aims to connect gut microbiome composition to diseases using global datasets from the Human Gut Microbiome Atlas. The goal was to evaluate how accurately different machine learning algorithms could classify microbiota species and diseases and predict disease associations by comparing westernized and non-westernized populations, including both cancerous and noncancerous groups. These findings can contribute to the future creation of population-specific and disease-specific microbial models.

Matching journals

The top 6 journals account for 50% of the predicted probability mass.

1
BMC Microbiology
49 papers in training set
Top 0.1%
13.1%
2
PLOS ONE
5266 papers in training set
Top 17%
10.8%
3
Frontiers in Microbiology
427 papers in training set
Top 0.7%
9.8%
4
mSystems
394 papers in training set
Top 0.8%
8.0%
5
Scientific Reports
3612 papers in training set
Top 10%
6.8%
6
PLOS Computational Biology
1863 papers in training set
Top 6%
5.6%
50% of probability mass above
7
Microbiome
154 papers in training set
Top 0.9%
3.3%
8
BMC Genomics
406 papers in training set
Top 3%
2.4%
9
PeerJ
308 papers in training set
Top 4%
2.4%
10
Briefings in Bioinformatics
354 papers in training set
Top 3%
2.4%
11
Computational and Structural Biotechnology Journal
242 papers in training set
Top 3%
2.0%
12
mSphere
302 papers in training set
Top 4%
1.8%
13
BMC Bioinformatics
457 papers in training set
Top 4%
1.7%
14
BioData Mining
22 papers in training set
Top 0.3%
1.7%
15
GigaScience
212 papers in training set
Top 2%
1.7%
16
Microbiology Spectrum
469 papers in training set
Top 7%
1.5%
17
Environmental Microbiome
29 papers in training set
Top 0.5%
1.5%
18
iMeta
10 papers in training set
Top 0.1%
1.1%
19
Frontiers in Genetics
230 papers in training set
Top 4%
1.1%
20
Bioinformatics
1204 papers in training set
Top 8%
0.9%
21
Frontiers in Cellular and Infection Microbiology
109 papers in training set
Top 3%
0.9%
22
Journal of Medical Internet Research
87 papers in training set
Top 3%
0.9%
23
F1000Research
88 papers in training set
Top 4%
0.9%
24
FEMS Microbiology Ecology
54 papers in training set
Top 1%
0.9%
25
BMC Medical Genomics
50 papers in training set
Top 1%
0.9%
26
BioMed Research International
28 papers in training set
Top 2%
0.9%
27
Frontiers in Immunology
638 papers in training set
Top 10%
0.6%
28
Computers in Biology and Medicine
128 papers in training set
Top 5%
0.6%
29
Communications Biology
993 papers in training set
Top 34%
0.6%