Back

Comparing Physicians' Assessments of Context-specific AI-powered clinical reasoning assistant with General-Purpose AI agent: A Prospective Multi-Site Physician Evaluation of VITA versus ChatGPT in India and Bangladesh

Mandke, C.; Agrawal, H. K.; Bharti, B.; Chansoria, M.; Gupta, G.; Rawat, S. K.; Sarkar, N. K.; Singh, A.; PS, S.; Walia, S.; VALID (Validation of AI in Low-resource and Indian Domains) Consortium,

2026-04-30 health systems and quality improvement
10.64898/2026.04.30.26351194 medRxiv
Show abstract

BackgroundHealthcare providers in low- and middle-income countries (LMICs) are increasingly relying on Artificial Intelligence (AI) tools, yet most available AI assistants are general-purpose systems not designed for the specific clinical, epidemiological, and resource contexts of these settings. There is no evidence, from physicians assessments, on whether clinical reasoning support from purpose-built, context-specific and retrieval-augmented AI tools can outperform general-purpose AI agents. MethodsWe conducted a prospective multi-site validation study enrolling 37 physicians across India and Bangladesh. Each physician evaluated two AI tools (a) VITA (Validated Intelligence for Treatment and Assessment), a purpose-built (context-specific and retrieval-augmented) clinical reasoning AI assistant trained on India-specific guidelines, antimicrobial resistance patterns, and formulary constraints, and (b) ChatGPT Plus (version 5.2), a leading general-purpose AI assistant on six hypothetical clinical case vignettes (three predefined, three physician-selected). Evaluations were scored across six dimensions (differential diagnosis, clinical workup, treatment recommendation, dosing, clinical decision-making, and evidence quality) on a 1-5 Likert scale, yielding 444 observations. Analyses included paired t-tests, Wilcoxon signed-rank tests, and multivariate regressions with robust standard errors. ResultsVITA scored significantly higher than ChatGPT across all six evaluation dimensions. The mean composite score (sum of all dimensions, maximum = 30) was 25.4 for VITA versus 22.3 for ChatGPT (difference = +3.1 points, t = 8.31, p < 0.001). The largest advantage was in evidence quality (VITA: 4.46 vs. ChatGPT: 3.14, a 42% relative gap). VITAs advantage was consistent across both predefined and doctor-defined hypothetical cases and was robust to controls for physician demographics, case type, and evaluation order in multivariate regression (coefficient = +3.08, p < 0.001). ConclusionsIn this first systematic head-to-head physician evaluation of a purpose-built clinical reasoning AI assistant versus general-purpose AI in an LMIC setting, physicians consistently rated the context-specific tool as superior. These findings suggest that contextual relevance--including local guidelines, formulary constraints, and resistance patterns--matters for clinical AI adoption and quality in resource-limited settings.

Matching journals

The top 6 journals account for 50% of the predicted probability mass.

1
PLOS ONE
5266 papers in training set
Top 16%
11.9%
2
PLOS Global Public Health
344 papers in training set
Top 1%
11.9%
3
BMC Health Services Research
51 papers in training set
Top 0.2%
9.7%
4
PLOS Digital Health
106 papers in training set
Top 0.6%
7.9%
5
BMJ Open Quality
17 papers in training set
Top 0.1%
5.5%
6
Frontiers in Digital Health
24 papers in training set
Top 0.3%
4.3%
50% of probability mass above
7
Journal of the American Medical Informatics Association
71 papers in training set
Top 0.8%
4.1%
8
Clinical Trials
11 papers in training set
Top 0.1%
3.2%
9
BMJ Global Health
113 papers in training set
Top 1%
2.5%
10
BMJ Health & Care Informatics
15 papers in training set
Top 0.4%
2.5%
11
Trials
29 papers in training set
Top 0.4%
2.4%
12
BMJ Open
601 papers in training set
Top 8%
2.1%
13
Medical Decision Making
12 papers in training set
Top 0.1%
2.1%
14
Communications Medicine
113 papers in training set
Top 2%
1.7%
15
BMC Medical Informatics and Decision Making
43 papers in training set
Top 1%
1.7%
16
The American Journal of Tropical Medicine and Hygiene
68 papers in training set
Top 1%
1.3%
17
PLOS Medicine
110 papers in training set
Top 2%
1.3%
18
Risk Management and Healthcare Policy
10 papers in training set
Top 0.4%
1.1%
19
npj Digital Medicine
118 papers in training set
Top 3%
1.1%
20
Healthcare
17 papers in training set
Top 0.6%
1.1%
21
BMC Medicine
176 papers in training set
Top 4%
1.0%
22
Medicine
31 papers in training set
Top 2%
0.8%
23
Cancer Medicine
26 papers in training set
Top 1%
0.8%
24
Wellcome Open Research
67 papers in training set
Top 2%
0.8%
25
JAMA Network Open
130 papers in training set
Top 4%
0.8%
26
Frontiers in Public Health
148 papers in training set
Top 6%
0.8%
27
Biology Methods and Protocols
61 papers in training set
Top 2%
0.8%
28
Health Policy
11 papers in training set
Top 0.6%
0.8%
29
Journal of Clinical Pathology
15 papers in training set
Top 0.5%
0.8%
30
JAC-Antimicrobial Resistance
14 papers in training set
Top 0.4%
0.8%