Back

Evaluation of four large language models on complex, infectious disease case scenarios

Pradhan, A.; Waxse, B.; Matias, W. R.; Mercaldo, S.; Bowman, K.; Nutt, C.; Kanjilal, S.; Hillis, J. M.

2026-07-15 infectious diseases
10.64898/2026.07.14.26358021 medRxiv
Show abstract

Objectives: Large language models (LLMs) are increasingly used in medicine, but evaluation is often on multiple choice questions and management of common conditions. Infectious diseases (ID) can present complex scenarios that require considerations beyond guideline-based responses. We assessed LLM performance in these situations including with ID-specific criteria to consider infection control or antimicrobial stewardship (AMS). Methods: We evaluated four LLMs (Claude 3.5 Sonnet, GPT-4o, GPT-o1, and a local instance of Llama 3.1 8B) in October 2024, on five complex ID vignettes. The LLM responses were each evaluated for 18 items by two board-certified ID clinicians and pairwise comparisons were performed between LLMs. Results: There was no significant difference between performance of GPT-o1, GPT-4o and Claude Sonnet on general medical criteria, and were comparable with respect to how often they provided an unsafe response (GPT-o1 30%, GPT-4o 40%, Claude 37%) and contained a critical omission (GPT-o1 27%, GPT-4o 43%, Claude 47%). Llama 3.1 8B had significantly decreased performance for most criteria. On ID-specific criteria, GPT-o1 outperformed other models and all models significantly outperformed Llama for interpreting microbiology results, AMS principles, appropriate antimicrobial spectrum and infection control considerations. Performance was poor in secondary prevention and management of risk factors. Conclusions: On complex ID scenarios, LLM responses were variable. The open-source, smaller Llama 3.1 8B model performed poorly and large, non-reasoning models varied, but more than 30% of responses containing a risk of harm or critical omission. These findings suggest caution is required when deploying these models in ID domains without specialist oversight.

Matching journals

The top 12 journals account for 50% of the predicted probability mass.

1
Epidemics
116 papers in training set
Top 0.3%
7.4%
2
Journal of the American Medical Informatics Association
71 papers in training set
Top 0.5%
6.4%
3
PLOS ONE
5266 papers in training set
Top 27%
5.7%
4
BMC Infectious Diseases
133 papers in training set
Top 0.4%
5.3%
5
PLOS Digital Health
106 papers in training set
Top 1%
4.4%
6
PLOS Global Public Health
344 papers in training set
Top 4%
3.6%
7
JAMIA Open
42 papers in training set
Top 0.5%
3.5%
8
npj Digital Medicine
118 papers in training set
Top 1%
3.5%
9
American Journal of Infection Control
12 papers in training set
Top 0.1%
3.3%
10
BMC Health Services Research
51 papers in training set
Top 0.8%
2.7%
11
Open Forum Infectious Diseases
142 papers in training set
Top 1%
2.4%
12
Journal of Medical Internet Research
87 papers in training set
Top 1%
2.4%
50% of probability mass above
13
eBioMedicine
183 papers in training set
Top 2%
1.8%
14
American Journal of Epidemiology
67 papers in training set
Top 0.6%
1.8%
15
Value in Health
11 papers in training set
Top 0.2%
1.8%
16
Frontiers in Public Health
148 papers in training set
Top 4%
1.4%
17
JAMA Network Open
130 papers in training set
Top 2%
1.4%
18
Frontiers in Digital Health
24 papers in training set
Top 1%
1.2%
19
Clinical Infectious Diseases
235 papers in training set
Top 2%
1.2%
20
Communications Medicine
113 papers in training set
Top 3%
1.2%
21
Frontiers in Medicine
120 papers in training set
Top 3%
1.1%
22
Scientific Reports
3612 papers in training set
Top 70%
1.0%
23
BMC Medical Education
21 papers in training set
Top 0.5%
1.0%
24
Journal of Biomedical Informatics
47 papers in training set
Top 1%
0.9%
25
Pharmacoepidemiology and Drug Safety
18 papers in training set
Top 0.5%
0.9%
26
Infection Control & Hospital Epidemiology
17 papers in training set
Top 0.3%
0.9%
27
Systematic Reviews
15 papers in training set
Top 0.5%
0.9%
28
PLOS Computational Biology
1863 papers in training set
Top 19%
0.9%
29
Medical Decision Making
12 papers in training set
Top 0.4%
0.9%
30
Healthcare
17 papers in training set
Top 1.0%
0.9%