Back

Phenome-Wide Association Study of Pre-Cancer Diagnosis Electronic Health Records Identifies Risk and Inverse Associations in the All of Us Research Program

Rich, C. C. D.; Bang, E. J.; Bair, A. B.; Richardson, B. E.; Millington, J. L.; Bates, B. A.; Davis, M. F.; Bailey, M. H.

2026-05-28 health informatics
10.64898/2026.05.26.26353823 medRxiv
Show abstract

Background: The All of Us Research Program represents a rich resource for cancer epidemiology research, with over 400,000 participants with whole genome sequences linked to electronic health records (EHR). Large cancer datasets often focus exclusively on cases without controls and neglect pre-diagnosis healthcare occurrences. Here, we perform a phenome-wide association study (PheWAS) of EHR data at least 1 year pre-diagnosis between cancer cases and matched controls, revealing co-occurring and mutually exclusive phenotypes. Methods: We identified 55,000+ cancer cases across 21 cancer types in All of Us version 8. To eliminate age-related confounding, we implemented a two-stage matching and censoring strategy: loose matching on demographics to establish index dates and cohort comparability, followed by right-censoring of EHR data (excluding 1 year pre-diagnosis/index), then 1:2 matching to address residual demographic imbalance. We tested associations between 23,193 cancer cases, 46,386 matched controls and approximately 1,600 clinical phenotypes using logistic regression adjusted for sex at birth, self-reported race, age at diagnosis/index date, and two censored EHR metrics: observation window and unique condition count, with Bonferroni correction for multiple testing. Results: Our analysis identified 232 significantly associated phenotypes, confirming established cancer risk factors including elevated prostate specific antigen (OR = 2.92, 95% CI: 2.65-3.23; p-value=1.8x10-101) and multinodular goiter (OR = 1.73, 95% CI: 1.56-1.91; p-value=6.7x10-27). Further investigation into the relationship between several phenotypes with seeming inverse effects is warranted. Conclusions: This PheWAS of EHR data at least 1 year pre-diagnosis leveraged the diversity of All of Us to examine how clinical phenotypes prior to cancer diagnosis vary across cancer types and racial groups. Our findings validate All of Us as a robust platform for cancer epidemiology research, confirming established risk factors at scale across diverse populations. This work provides methodological insights for EHR-based susceptibility analyses and demonstrates the value of agnostic phenome-wide approaches for generating hypotheses in precision medicine.

Matching journals

The top 9 journals account for 50% of the predicted probability mass.

1
Cancer Medicine
26 papers in training set
Top 0.1%
9.5%
2
Scientific Reports
3612 papers in training set
Top 6%
8.8%
3
Nature Communications
5641 papers in training set
Top 22%
7.2%
4
Communications Medicine
113 papers in training set
Top 0.3%
6.6%
5
The American Journal of Human Genetics
234 papers in training set
Top 0.9%
5.4%
6
European Journal of Cancer
11 papers in training set
Top 0.1%
4.0%
7
Journal of the American Medical Informatics Association
71 papers in training set
Top 1.0%
3.2%
8
PLOS ONE
5266 papers in training set
Top 38%
3.2%
9
Nature Medicine
125 papers in training set
Top 0.9%
2.8%
50% of probability mass above
10
Cell Genomics
172 papers in training set
Top 1%
2.6%
11
JCO Clinical Cancer Informatics
22 papers in training set
Top 0.3%
2.4%
12
Cancer Epidemiology, Biomarkers & Prevention
20 papers in training set
Top 0.2%
2.1%
13
GENETICS
483 papers in training set
Top 2%
2.1%
14
Annals of Internal Medicine
28 papers in training set
Top 0.2%
1.9%
15
JAMIA Open
42 papers in training set
Top 0.9%
1.7%
16
Journal of Personalized Medicine
28 papers in training set
Top 0.4%
1.7%
17
JAMA Network Open
130 papers in training set
Top 2%
1.5%
18
npj Digital Medicine
118 papers in training set
Top 2%
1.5%
19
Science Advances
1243 papers in training set
Top 22%
1.5%
20
JNCI: Journal of the National Cancer Institute
19 papers in training set
Top 0.2%
1.4%
21
Journal of Biomedical Informatics
47 papers in training set
Top 1.0%
1.1%
22
Genetics in Medicine
78 papers in training set
Top 0.8%
1.1%
23
iScience
1154 papers in training set
Top 27%
1.1%
24
GigaScience
212 papers in training set
Top 3%
1.1%
25
BMJ
51 papers in training set
Top 0.9%
1.0%
26
Scientific Data
209 papers in training set
Top 2%
1.0%
27
eLife
5828 papers in training set
Top 62%
1.0%
28
Bioinformatics
1204 papers in training set
Top 8%
1.0%
29
Cell Reports Medicine
153 papers in training set
Top 5%
0.8%
30
BMC Medical Genomics
50 papers in training set
Top 1%
0.8%