Back

Separation-like irregularity and sample size optimism in high-discrimination logistic prediction models

Liu, Z.; Liang, Y.; Wang, L. S.; Yu, J.; Liu, J.

2026-01-23 health informatics
10.64898/2026.01.21.26344587 medRxiv
Show abstract

Closed-form minimum sample size criteria for developing logistic prediction models, such as the Riley framework implemented in pmsampsize, are widely used but may become optimistic when anticipated discrimination is high. We conducted a Monte Carlo simulation study to compare the formula-based recommended development sample size, nRiley, with an empirical required sample size, nreq, defined by out-of-sample calibration-slope stability under repeated development sampling. Scenarios fixed the candidate parameter dimension at p = 10 and crossed predictor distribution (normal, standardized skewed continuous, binary), signal density (dense versus sparse), prevalence ({phi} [isin] {0.05, 0.10, 0.20}), and target discrimination (AUCtarget [isin] {0.70, 0.75, 0.80, 0.85, 0.90}), with intercept and signal strength calibrated to match targets. We defined nreq as the smallest n such that [E] (bn) [&ge;] 0.90 and Pr(bn < 0.80) [&le;] 0.20, where bn is the truth-based logit-scale calibration slope evaluated on a large fixed validation covariate set. At moderate discrimination, nRiley approximated nreq, but as discrimination increased the formula increasingly underestimated the sample size required for calibration stability, with large deficits at AUCtarget = 0.90. Separation-like behavior (extreme fitted risks and linear predictors) at n = nRiley became common in high-discrimination settings despite nominal convergence, providing a plausible mechanism for formula optimism. These findings support augmenting formula-based planning with targeted simulation stress tests and instability diagnostics when high discrimination is anticipated.

Matching journals

The top 6 journals account for 50% of the predicted probability mass.

1
Medical Decision Making
12 papers in training set
Top 0.1%
12.8%
2
PLOS ONE
5266 papers in training set
Top 16%
12.0%
3
BMC Medical Research Methodology
47 papers in training set
Top 0.1%
9.7%
4
PLOS Computational Biology
1863 papers in training set
Top 6%
6.3%
5
npj Digital Medicine
118 papers in training set
Top 1%
5.5%
6
Scientific Reports
3612 papers in training set
Top 22%
4.4%
50% of probability mass above
7
Journal of the American Medical Informatics Association
71 papers in training set
Top 0.8%
4.1%
8
JAMA Network Open
130 papers in training set
Top 1%
3.2%
9
Annals of Internal Medicine
28 papers in training set
Top 0.1%
2.8%
10
JMIR Public Health and Surveillance
45 papers in training set
Top 0.5%
1.9%
11
Philosophical Transactions of the Royal Society B
51 papers in training set
Top 0.3%
1.7%
12
Frontiers in Public Health
148 papers in training set
Top 5%
1.1%
13
BMC Medical Informatics and Decision Making
43 papers in training set
Top 1%
1.1%
14
Nature Communications
5641 papers in training set
Top 51%
1.1%
15
Frontiers in Artificial Intelligence
20 papers in training set
Top 0.5%
1.1%
16
Frontiers in Psychiatry
87 papers in training set
Top 2%
1.1%
17
Statistics in Medicine
40 papers in training set
Top 0.5%
1.1%
18
Computational Psychiatry
12 papers in training set
Top 0.1%
1.0%
19
JAMIA Open
42 papers in training set
Top 1%
1.0%
20
Frontiers in Digital Health
24 papers in training set
Top 1%
1.0%
21
Journal of Biomedical Informatics
47 papers in training set
Top 1%
1.0%
22
PLOS Digital Health
106 papers in training set
Top 4%
1.0%
23
Neurorehabilitation and Neural Repair
21 papers in training set
Top 0.5%
0.8%
24
Frontiers in Neuroscience
256 papers in training set
Top 6%
0.8%
25
IEEE Journal of Biomedical and Health Informatics
37 papers in training set
Top 1%
0.8%
26
Physical Review X
25 papers in training set
Top 0.5%
0.8%
27
Frontiers in Psychology
56 papers in training set
Top 1%
0.8%
28
International Journal of Medical Informatics
26 papers in training set
Top 1%
0.8%
29
Biostatistics
24 papers in training set
Top 0.4%
0.6%
30
PNAS Nexus
159 papers in training set
Top 4%
0.6%