Back

Failure detection in medical image classification under realistic distribution shifts: A large-scale benchmark

Steinmetz, P.; Frouin, F.; Morard, V.; Buvat, I.

2026-05-05 radiology and imaging
10.64898/2026.05.04.26350496 medRxiv
Show abstract

Medical images (MI) exhibit variability due to different acquisition protocols, devices, and patient populations, making failure detection at inference time essential for reliable deployment of clinical classifiers. As existing evaluations of failure detection methods use different settings, it is difficult to compare results and identify the best strategy, if any. We present a comprehensive benchmark of eight confidence scoring functions and two score-aggregation strategies across eight MI tasks spanning diverse modalities, backbone architectures, training setups, and failure sources. The confidence ranking ability and classification error mitigation are jointly evaluated. While no single method systematically dominated across settings, aggregation of confidence scores consistently matched or approached the best individual method and substantially reduced silent failure rate. The failure detection performance was strongly correlated with classifier accuracy for all tested settings. These findings provide large-scale evidence regarding the strengths and limitations of confidence scoring strategies and offer actionable guidance for mitigating silent failures under realistic distribution shifts in MI.

Matching journals

The top 8 journals account for 50% of the predicted probability mass.

1
npj Digital Medicine
118 papers in training set
Top 0.4%
18.0%
2
Scientific Reports
3612 papers in training set
Top 5%
9.5%
3
PLOS ONE
5266 papers in training set
Top 29%
5.3%
4
Medical Physics
14 papers in training set
Top 0.1%
4.3%
5
Nature Communications
5641 papers in training set
Top 33%
3.9%
6
IEEE Access
35 papers in training set
Top 0.3%
3.9%
7
PLOS Digital Health
106 papers in training set
Top 1%
3.9%
8
Nature Machine Intelligence
70 papers in training set
Top 0.7%
3.9%
50% of probability mass above
9
IEEE Transactions on Medical Imaging
21 papers in training set
Top 0.2%
3.1%
10
Imaging Neuroscience
282 papers in training set
Top 2%
2.7%
11
Medical Image Analysis
35 papers in training set
Top 0.3%
2.6%
12
Journal of Medical Imaging
11 papers in training set
Top 0.1%
2.4%
13
GigaScience
212 papers in training set
Top 2%
2.1%
14
European Heart Journal - Digital Health
18 papers in training set
Top 0.5%
2.1%
15
Patterns
78 papers in training set
Top 1%
2.1%
16
European Radiology
15 papers in training set
Top 0.4%
1.7%
17
Journal of the American Medical Informatics Association
71 papers in training set
Top 1%
1.7%
18
Computers in Biology and Medicine
128 papers in training set
Top 3%
1.4%
19
npj Precision Oncology
53 papers in training set
Top 1%
1.4%
20
Communications Medicine
113 papers in training set
Top 3%
1.4%
21
Biomedical Optics Express
95 papers in training set
Top 0.8%
1.1%
22
Nature Medicine
125 papers in training set
Top 3%
1.1%
23
NeuroImage
903 papers in training set
Top 5%
1.1%
24
IEEE Transactions on Biomedical Engineering
40 papers in training set
Top 0.9%
1.0%
25
Diagnostics
50 papers in training set
Top 2%
1.0%
26
Photoacoustics
12 papers in training set
Top 0.3%
0.8%
27
Journal of Pathology Informatics
15 papers in training set
Top 0.3%
0.8%
28
BMC Medical Informatics and Decision Making
43 papers in training set
Top 2%
0.8%
29
Communications Biology
993 papers in training set
Top 32%
0.8%
30
Advanced Science
286 papers in training set
Top 10%
0.8%