Back

A Multimodal Benchmark for Evaluating Cause-of-Death Inference Using Child Health and Mortality Data

Yang, J.; Pan, S.; Lim, H. S.; Chu, Y.; Guo, Y.; Agarwal, N.; Babbar, V.; Parikh, G. R.; Chen, Y. T.; Rees, C. A.; Dangor, Z.; Lala, S. G.; Li, Z. R.; Clark, S. J.; Wu, Z.; Datta, A.; Liu, L.; Rudin, C.; Scarpino, S. V.; Gyori, B. M.; McCormick, T. H.

2026-07-15 public and global health
10.64898/2026.07.13.26357980 medRxiv
Show abstract

Accurately attributing causes of death is vital for global health, yet fewer than 5% of deaths in resource-constrained regions are medically certified. To assign causes to these unlabeled deaths at scale, practitioners traditionally rely on verbal autopsy, using supervised statistical models to classify based on structured survey data. However, modern mortality surveillance increasingly collects rich, unstructured multimodal data, such as free-text caregiver narratives and postmortem diagnostics, which traditional supervised statistical models struggle to seamlessly integrate. In this paper, we present a comprehensive, multimodal benchmark for cause-of-death classification using data from the Child Health and Mortality Prevention Surveillance (CHAMPS) network, a unique surveillance platform spanning nine countries across South Asia and Sub-Saharan Africa. Using this dataset, we introduce an evaluation framework designed to rigorously assess diagnostic reasoning, moving beyond traditional metrics that fail to capture complex clinical realities. We demonstrate the utility of this benchmark by evaluating zero-shot large language models against supervised baselines across various data modalities. Our results reveal distinct differences in how these modeling approaches synthesize unstructured medical evidence. This benchmark provide a rigorously defined resource for assessing clinical reasoning in next-generation mortality surveillance.

Matching journals

The top 5 journals account for 50% of the predicted probability mass.

1
Nature Medicine
125 papers in training set
Top 0.1%
18.2%
2
npj Digital Medicine
118 papers in training set
Top 0.4%
18.2%
3
Patterns
78 papers in training set
Top 0.2%
6.1%
4
American Journal of Epidemiology
67 papers in training set
Top 0.2%
5.4%
5
PLOS ONE
5266 papers in training set
Top 33%
4.2%
50% of probability mass above
6
Scientific Data
209 papers in training set
Top 0.7%
4.0%
7
Scientific Reports
3612 papers in training set
Top 27%
4.0%
8
PLOS Digital Health
106 papers in training set
Top 2%
3.2%
9
Proceedings of the National Academy of Sciences
2444 papers in training set
Top 17%
3.2%
10
Nature Communications
5641 papers in training set
Top 38%
2.7%
11
Journal of the American Medical Informatics Association
71 papers in training set
Top 1%
2.3%
12
PLOS Global Public Health
344 papers in training set
Top 5%
2.1%
13
eLife
5828 papers in training set
Top 45%
2.1%
14
International Journal of Epidemiology
88 papers in training set
Top 0.9%
1.7%
15
Journal of Medical Internet Research
87 papers in training set
Top 2%
1.5%
16
The Lancet Digital Health
25 papers in training set
Top 0.5%
1.1%
17
PLOS Computational Biology
1863 papers in training set
Top 17%
1.1%
18
JAMA Network Open
130 papers in training set
Top 3%
1.0%
19
Epidemics
116 papers in training set
Top 2%
1.0%
20
Biology Methods and Protocols
61 papers in training set
Top 2%
0.9%
21
BMJ Open
601 papers in training set
Top 13%
0.8%
22
Frontiers in Psychiatry
87 papers in training set
Top 2%
0.8%
23
Journal of Biomedical Informatics
47 papers in training set
Top 1%
0.6%
24
iScience
1154 papers in training set
Top 41%
0.6%
25
IEEE Access
35 papers in training set
Top 2%
0.6%
26
Communications Medicine
113 papers in training set
Top 6%
0.6%