Back

Establishing the Automatic Identification of Clinical Trial Cohorts from Electronic Health Records by Matching Normalized Eligibility Criteria and Patient Clinical Characteristics

Mai, Y.; lee, k.; Liu, Z.; Raja, K.; Higashi, M. K.; Ma, M.; Wang, T.; Ai, L.; Calay, E.; Oh, W.; Schadt, E.; wang, x.

2024-03-02 oncology
10.1101/2024.02.28.24303396 medRxiv
Show abstract

The use of electronic health records (EHRs) holds the potential to enhance clinical trial activities. However, the identification of eligible patients within EHRs presents considerable challenges. We aimed to develop a pipeline for phenotyping eligibility criteria, enabling the identification of patients from EHRs with clinical characteristics that match those criteria. We utilized clinical trial eligibility criteria and patient EHRs from the Mount Sinai Database. The criteria and EHR data were normalized using national standard terminologies and in-house databases, facilitating computability and queryability. The pipeline employed rule-based pattern recognition and manual annotation. Our pipeline normalized 367 out of 640 unique eligibility criteria attributes, covering various medical conditions including non-small cell lung cancer, small cell lung cancer, prostate cancer, breast cancer, multiple myeloma, ulcerative colitis, Crohns disease, non-alcoholic steatohepatitis, and sickle cell anemia. 174 were encoded with standard terminologies and 193 were normalized using the in-house reference tables. The agreement between automated and manual normalization was high (Cohens Kappa = 0.82), and patient matching demonstrated a 0.94 F1 score. Our system has proven effective on EHRs from multiple institutions, showing broad applicability and promising improved clinical trial processes, leading to better patient selection, and enhanced clinical research outcomes.

Matching journals

The top 5 journals account for 50% of the predicted probability mass.

1
Database
61 papers in training set
Top 0.1%
22.8%
2
Journal of Biomedical Informatics
47 papers in training set
Top 0.1%
10.0%
3
Journal of the American Medical Informatics Association
71 papers in training set
Top 0.3%
10.0%
4
PLOS ONE
5266 papers in training set
Top 32%
4.4%
5
JAMIA Open
42 papers in training set
Top 0.4%
4.4%
50% of probability mass above
6
npj Digital Medicine
118 papers in training set
Top 1%
3.5%
7
JCO Clinical Cancer Informatics
22 papers in training set
Top 0.2%
3.3%
8
BMC Medical Informatics and Decision Making
43 papers in training set
Top 0.6%
3.2%
9
Artificial Intelligence in Medicine
17 papers in training set
Top 0.1%
3.2%
10
JMIR Medical Informatics
18 papers in training set
Top 0.3%
2.5%
11
PLOS Computational Biology
1863 papers in training set
Top 12%
2.2%
12
Scientific Reports
3612 papers in training set
Top 50%
1.9%
13
GigaScience
212 papers in training set
Top 2%
1.8%
14
iScience
1154 papers in training set
Top 20%
1.5%
15
Journal of Translational Medicine
57 papers in training set
Top 0.9%
1.5%
16
Scientific Data
209 papers in training set
Top 2%
1.5%
17
PeerJ
308 papers in training set
Top 6%
1.5%
18
Genomics, Proteomics & Bioinformatics
172 papers in training set
Top 1%
1.5%
19
eLife
5828 papers in training set
Top 56%
1.1%
20
Journal of Personalized Medicine
28 papers in training set
Top 0.7%
1.1%
21
eBioMedicine
183 papers in training set
Top 5%
1.0%
22
Computers in Biology and Medicine
128 papers in training set
Top 4%
1.0%
23
Communications Medicine
113 papers in training set
Top 4%
1.0%
24
Briefings in Bioinformatics
354 papers in training set
Top 7%
0.9%
25
Journal of Medical Internet Research
87 papers in training set
Top 3%
0.9%
26
Diagnostics
50 papers in training set
Top 2%
0.9%
27
BMJ Open
601 papers in training set
Top 13%
0.6%
28
Biology Methods and Protocols
61 papers in training set
Top 3%
0.6%
29
Nature Communications
5641 papers in training set
Top 59%
0.6%
30
Computer Methods and Programs in Biomedicine
28 papers in training set
Top 1%
0.6%