Back

Infoxmed2.0-27B: Instruction Tuning, Preference Alignment, and GRPO-Based Reward Model Training for Medical LLMs

Xie, J.; Guo, Z.; Zhao, H.; Ni, H.

2026-06-30 medical education
10.64898/2026.06.25.26356522 medRxiv
Show abstract

Abstract-Large language models (LLMs) [1], [2] have demon strated remarkable capabilities across general domains, yet their application in specialized medical contexts demands rigorous domain adaptation [3], [4]. We present Infoxmed2.0-27B, a medical foundation model built upon Qwen3.5-27B [5] through a comprehensive multi-stage post-training pipeline: (1) proprietary medical data synthesis from a MySQL database with MedicalCategoryTree organization, medical PhD team validation, Chinese RoBERTa [6] semantic deduplication, and API-assisted language refinement; (2) instruction supervised fine-tuning of Qwen3.5- 27B via LoRA [7] (r = 8, = 32) using MS-Swift [8], producing iterations Infoxmed2.0.0[->]2.0.2[->]2.0.4; (3) Direct Preference Optimization (DPO) [9] on 6,283 curated medical preference pairs [10] using DPO-RPO loss ({beta} = 0.3, RPO = 0.1) across eight progressive training iterations (v0-v7); and (4) parallel Group Relative Policy Optimization (GRPO) [11]-based medical reward model training on Qwen3.5 combining internal rule-based reward functions with external DeepSeek signals. Comprehensive evaluations under a uniform LLM-as-Judge [12] framework with GPT-5.4 demonstrate 77.0% accuracy (mean quality score +7.18) on MedMCQA [10] and +2.59 on HLE, with pipeline progression from +6.69 (base) to +7.06 (SFT) to +7.18 (final).

Matching journals

The top 11 journals account for 50% of the predicted probability mass.

1
npj Digital Medicine
118 papers in training set
Top 0.4%
15.7%
2
Scientific Reports
3612 papers in training set
Top 9%
7.0%
3
PLOS ONE
5266 papers in training set
Top 32%
4.5%
4
Journal of Medical Internet Research
87 papers in training set
Top 0.5%
4.5%
5
Heliyon
152 papers in training set
Top 1%
3.4%
6
PLOS Digital Health
106 papers in training set
Top 2%
3.4%
7
Patterns
78 papers in training set
Top 0.5%
3.3%
8
GigaScience
212 papers in training set
Top 1%
2.7%
9
Nature Communications
5641 papers in training set
Top 38%
2.7%
10
Journal of Biomedical Informatics
47 papers in training set
Top 0.6%
2.5%
11
BMC Medicine
176 papers in training set
Top 2%
2.5%
50% of probability mass above
12
eLife
5828 papers in training set
Top 43%
2.2%
13
Nature Computational Science
55 papers in training set
Top 0.4%
2.2%
14
IEEE Journal of Biomedical and Health Informatics
37 papers in training set
Top 0.5%
2.2%
15
Frontiers in Digital Health
24 papers in training set
Top 0.7%
1.8%
16
Bioinformatics
1204 papers in training set
Top 7%
1.8%
17
IEEE Transactions on Computational Biology and Bioinformatics
20 papers in training set
Top 0.2%
1.8%
18
Bioinformatics Advances
203 papers in training set
Top 3%
1.6%
19
iScience
1154 papers in training set
Top 22%
1.4%
20
Nature Machine Intelligence
70 papers in training set
Top 2%
1.4%
21
Genome Biology
637 papers in training set
Top 7%
1.2%
22
IEEE Access
35 papers in training set
Top 0.9%
1.2%
23
Nature Methods
385 papers in training set
Top 5%
1.2%
24
Nature Medicine
125 papers in training set
Top 2%
1.2%
25
Journal of Molecular Biology
232 papers in training set
Top 3%
1.2%
26
Nature
645 papers in training set
Top 9%
1.1%
27
Journal of the American Medical Informatics Association
71 papers in training set
Top 2%
1.1%
28
Communications Medicine
113 papers in training set
Top 4%
1.0%
29
Artificial Intelligence in Medicine
17 papers in training set
Top 0.6%
0.9%
30
BMC Bioinformatics
457 papers in training set
Top 5%
0.9%