Back

FHIRBench: Benchmarking FHIR Clinical Data Serialization Strategies for Large Language Models

Chong, J.

2026-07-15 health informatics
10.64898/2026.07.14.26358020 medRxiv
Show abstract

We present FHIRBench, a benchmark evaluating six FHIR clinical data serialization strategies across four frontier LLMs (Claude Sonnet 4.5, GPT-5.4, DeepSeek V3.2, Qwen3 32B) on three clinical tasks using 100 stratified synthetic FHIR R4 patient bundles. We employ two evaluation layers: token-level F1 and LLM-as-judge rubric on four clinical dimensions, yielding 7,200 evaluations per layer. Our findings reveal four results. First, serialization significantly impacts quality but the direction diverges between layers: Condensed outperforms Raw JSON on F1 for 3/4 models (Wilcoxon p < 10^-17), while Raw JSON achieves higher judge scores for 3/4 models (p < 10^-7). Narrative achieves 95% of Raw JSON's quality at 83% fewer tokens. Second, model rankings completely reverse between layers -- Claude ranks last on F1 but first on clinical quality (p = 1.0 x 10^-6), demonstrating that single-metric evaluation produces misleading model selection. Third, a significant Model x Serializer interaction (Friedman p = 0.0009) precludes universal format recommendations, with GPT-5.4 favoring Raw JSON while open-weight models favor compressed formats. Fourth, Llama 3.1 70B exhibits 100% inference failure on complex patients despite operating within its nominal context window, revealing a patient-safety gap where AI fails for the patients who need it most. These findings establish that clinical AI systems require model-aware serialization middleware, multi-layer evaluation frameworks, and capacity verification before deployment. Code and data publicly available.

Matching journals

The top 8 journals account for 50% of the predicted probability mass.

1
npj Digital Medicine
118 papers in training set
Top 0.4%
18.0%
2
Journal of the American Medical Informatics Association
71 papers in training set
Top 0.4%
8.7%
3
Scientific Reports
3612 papers in training set
Top 13%
6.1%
4
Bioinformatics
1204 papers in training set
Top 4%
4.7%
5
Journal of Biomedical Informatics
47 papers in training set
Top 0.4%
4.2%
6
PLOS Digital Health
106 papers in training set
Top 1%
4.2%
7
Patterns
78 papers in training set
Top 0.4%
3.9%
8
PLOS ONE
5266 papers in training set
Top 35%
3.9%
50% of probability mass above
9
JCO Clinical Cancer Informatics
22 papers in training set
Top 0.2%
3.4%
10
JAMIA Open
42 papers in training set
Top 0.5%
3.3%
11
Nature Medicine
125 papers in training set
Top 0.8%
3.2%
12
GigaScience
212 papers in training set
Top 1%
3.2%
13
iScience
1154 papers in training set
Top 8%
3.1%
14
BMC Medical Informatics and Decision Making
43 papers in training set
Top 0.8%
2.4%
15
Journal of Medical Internet Research
87 papers in training set
Top 2%
1.7%
16
Genome Biology
637 papers in training set
Top 6%
1.7%
17
Med
39 papers in training set
Top 0.2%
1.7%
18
Artificial Intelligence in Medicine
17 papers in training set
Top 0.4%
1.5%
19
Frontiers in Digital Health
24 papers in training set
Top 0.9%
1.5%
20
JMIR Medical Informatics
18 papers in training set
Top 0.5%
1.5%
21
Nature Communications
5641 papers in training set
Top 49%
1.3%
22
JAMA Network Open
130 papers in training set
Top 3%
1.0%
23
Communications Medicine
113 papers in training set
Top 4%
1.0%
24
BMJ Health & Care Informatics
15 papers in training set
Top 1.0%
0.8%
25
IEEE Journal of Biomedical and Health Informatics
37 papers in training set
Top 1%
0.8%
26
Computer Methods and Programs in Biomedicine
28 papers in training set
Top 1%
0.8%
27
Diagnostics
50 papers in training set
Top 3%
0.6%
28
International Journal of Medical Informatics
26 papers in training set
Top 2%
0.6%
29
The American Journal of Human Genetics
234 papers in training set
Top 3%
0.6%