Back

A Real-World Evaluation of Failure Detection for Liver CT Segmentation

Bennett, J.; Woodland, M.; Castelo, A.; Altaie, M.; Antony, A.; Siddiqi, N. S.; Long, J. P.; Brock, K. K.

2026-06-29 radiology and imaging
10.64898/2026.06.26.26356692 medRxiv
Show abstract

Deep learning models deployed in clinical imaging frequently encounter distribution shifts, yet most out-of-distribution (OOD) detection methods are evaluated only on controlled research datasets. As a result, it is unclear whether existing approaches can reliably identify segmentation failures that arise in real-world clinical practice. We evaluated six OOD detection methods on a deployed liver CT segmentation model (3D nnU-Net) using internal data from 400 patients and external data from 100 patients collected across nearly 70 sites in 7 countries. One method was Pairwise Surface DSC, a surface-based extension of Pairwise DSC, that we introduced. OOD performance was measured using sensitivity, AUROC, and balanced accuracy, with thresholds determined on an independent cohort of 400 patients using the Youden J statistic. Statistical significance was assessed using McNemar tests and stratified bootstraps ( = 0.05) with Benjamini-Hochberg correction. Pairwise Surface DSC was the top-performing method, with perfect sensitivities (1.00), near-perfect AUROCs (0.97 internal; 1.00 external), and the highest balanced accuracies (0.94 internal; 0.88 external; p<0.001). These results show that automated failure detection for liver CT segmentation is clinically feasible and that Pairwise Surface DSC is a promising candidate for deployment. Our code is available at https://github.com/mckellwoodland/liver_ct_ood_translation.

Matching journals

The top 8 journals account for 50% of the predicted probability mass.

1
Scientific Reports
3612 papers in training set
Top 7%
7.8%
2
Medical Physics
14 papers in training set
Top 0.1%
7.8%
3
European Radiology
15 papers in training set
Top 0.1%
6.7%
4
Journal of Medical Imaging
11 papers in training set
Top 0.1%
6.7%
5
npj Digital Medicine
118 papers in training set
Top 0.9%
6.2%
6
Nature Communications
5641 papers in training set
Top 27%
5.5%
7
Medical Image Analysis
35 papers in training set
Top 0.1%
5.4%
8
Journal of the American Medical Informatics Association
71 papers in training set
Top 0.6%
5.4%
50% of probability mass above
9
PLOS ONE
5266 papers in training set
Top 34%
4.0%
10
IEEE Transactions on Medical Imaging
21 papers in training set
Top 0.2%
3.2%
11
Nature Machine Intelligence
70 papers in training set
Top 0.9%
3.2%
12
PLOS Digital Health
106 papers in training set
Top 2%
1.9%
13
IEEE Access
35 papers in training set
Top 0.7%
1.7%
14
eBioMedicine
183 papers in training set
Top 2%
1.7%
15
Communications Medicine
113 papers in training set
Top 3%
1.5%
16
Patterns
78 papers in training set
Top 2%
1.5%
17
npj Precision Oncology
53 papers in training set
Top 1.0%
1.5%
18
PLOS Computational Biology
1863 papers in training set
Top 15%
1.5%
19
Diagnostics
50 papers in training set
Top 1%
1.3%
20
Frontiers in Medicine
120 papers in training set
Top 3%
1.1%
21
Nature Medicine
125 papers in training set
Top 2%
1.1%
22
Photoacoustics
12 papers in training set
Top 0.2%
1.1%
23
European Heart Journal - Digital Health
18 papers in training set
Top 0.8%
1.1%
24
Biology Methods and Protocols
61 papers in training set
Top 2%
1.1%
25
Frontiers in Bioinformatics
49 papers in training set
Top 1%
1.1%
26
Aperture Neuro
20 papers in training set
Top 0.4%
1.0%
27
BMC Medical Informatics and Decision Making
43 papers in training set
Top 2%
1.0%
28
SLAS Technology
14 papers in training set
Top 0.2%
1.0%
29
Physics in Medicine & Biology
18 papers in training set
Top 0.3%
0.8%
30
The Lancet Digital Health
25 papers in training set
Top 0.7%
0.8%