Back

Domain-specific LLM Development and Evaluation -- A Case-study for Prostate Cancer

Tariq, A.; Urooj, A.; Das, A.; Jeong, J.; Trivedi, S.; Patel, B.; Banerjee, I.

2024-03-16 oncology
10.1101/2024.03.15.24304362 medRxiv
Show abstract

In this work, we present our strategy for developing domain-specific large language models which cover the vocabulary of the target domain and train on reliable sources of clinical information. Prostate cancer was chosen as a use-case for this study. We collected more than 1.8 million clinical notes and radiology and pathology reports for 15341 patients treated for prostate cancer in Mayo Clinic across three sites and outpatient clinics. In addition to domain-specific training data, we built domain-specific tokenizers and devised knowledge-guided training strategies for LLM development. During the self-supervised training, LLM was forced to predict domain-specific information by marking clinical terms using UMLS parser. We evaluated the model for downstream tasks of clinical information prediction and question answering using quantitative and user evaluation study to measure the accuracy, reliability and information completeness. We compared the domain-specific model against similarly sized general purpose model GPT-2 and a three-times larger domain specialized model. i.e., BioGPT. Our model outperformed GPT-2 on both tasks by a wide margin. Our model was also able to outperform BioGPT on clinical information prediction tasks and showed some advantages over BioGPT in question-answering tasks.

Matching journals

The top 6 journals account for 50% of the predicted probability mass.

1
JCO Clinical Cancer Informatics
22 papers in training set
Top 0.1%
15.3%
2
Artificial Intelligence in Medicine
17 papers in training set
Top 0.1%
12.1%
3
Scientific Reports
3612 papers in training set
Top 8%
7.4%
4
JAMIA Open
42 papers in training set
Top 0.2%
7.4%
5
npj Digital Medicine
118 papers in training set
Top 0.8%
6.8%
6
PLOS ONE
5266 papers in training set
Top 34%
4.1%
50% of probability mass above
7
Biology Methods and Protocols
61 papers in training set
Top 0.3%
3.3%
8
iScience
1154 papers in training set
Top 6%
3.3%
9
Journal of Biomedical Informatics
47 papers in training set
Top 0.5%
2.7%
10
Computers in Biology and Medicine
128 papers in training set
Top 2%
2.4%
11
Journal of the American Medical Informatics Association
71 papers in training set
Top 1%
2.2%
12
PLOS Computational Biology
1863 papers in training set
Top 13%
1.9%
13
Database
61 papers in training set
Top 0.4%
1.8%
14
BMC Medical Informatics and Decision Making
43 papers in training set
Top 1%
1.5%
15
Frontiers in Bioinformatics
49 papers in training set
Top 0.6%
1.5%
16
Nature Communications
5641 papers in training set
Top 48%
1.5%
17
Cancers
213 papers in training set
Top 3%
1.5%
18
Frontiers in Oncology
103 papers in training set
Top 2%
1.4%
19
GigaScience
212 papers in training set
Top 3%
1.1%
20
Communications Medicine
113 papers in training set
Top 4%
1.0%
21
Patterns
78 papers in training set
Top 2%
1.0%
22
PLOS Digital Health
106 papers in training set
Top 4%
0.9%
23
BMJ Open
601 papers in training set
Top 12%
0.9%
24
Journal of Medical Internet Research
87 papers in training set
Top 3%
0.6%
25
Briefings in Bioinformatics
354 papers in training set
Top 7%
0.6%
26
European Journal of Human Genetics
58 papers in training set
Top 1%
0.6%
27
BioData Mining
22 papers in training set
Top 1.0%
0.6%
28
Journal of Translational Medicine
57 papers in training set
Top 3%
0.6%
29
Heliyon
152 papers in training set
Top 9%
0.6%
30
Proceedings of the National Academy of Sciences
2444 papers in training set
Top 44%
0.6%