Back

A Korean pangenome reference of 14 healthy individuals supports structural variant analysis in disease genomes

Shin, D.-H.; Jeon, J.; Joe, S.; Jeon, Y.; Yang, J. O.; Bhak, J.; Baek, S. A.; Byun, G.; Shin, E.-S.; Kwon, Y.; Choi, H.-J.; Kim, J.-H.; Haam, K.; Yoo, J.; Song, K. J.; Mok, J.; Jeon, S.; Jeong, H.; Bhak, J.

2026-07-09 genetic and genomic medicine
10.64898/2026.07.06.26357367 medRxiv
Show abstract

Here, we present the first graph-based Korean Pangenome Reference (K-PanRef), constructed from 14 healthy Korean individuals. K-PanRef comprises 13 high-quality diploid Korean genome assemblies (mean QV ~62.0) and KOREF1-G-TTAGGA, the first complete Korean reference genome. Integration of these assemblies generated a ~3.2-Gb pangenome graph containing ~39.3 million nodes and ~53.8 million edges, with the accumulation of common sequences (frequency [≥]10%) reaching a plateau. Additionally, K-PanRef contains ~4.3 million Korean-specific small variants and ~76.0 thousand Korean-specific SVs absent from the Chinese and human pangenome references, improving the representation of Korean genetic diversity relative to these references. To evaluate its utility for short-read-based SV analysis, we genotyped 75 whole-genome sequencing (WGS) samples, including 15 patients with early-onset myocardial infarction (MI). Although constructed entirely from healthy genomes, K-PanRef supported the identification of putative disease-relevant SVs in this exploratory application. K-PanRef-based genotyping identified ~95.6 thousand small variants and 820 SVs observed only in the early-onset MI samples. Among the early-onset MI-group SVs, 491 were absent from public databases, suggesting that they may represent previously unrecognized candidate variants related to early-onset MI. Of these, 164 SVs overlapped 134 genes, of which 89 had reported associations with 42 cardiovascular diseases or traits, including eight genes previously linked to MI. Together, these results establish K-PanRef as a valuable resource for representing Korean genetic diversity and enabling more comprehensive discovery of population-specific and novel putative disease-relevant variants from short-read sequencing data.

Matching journals

The top 7 journals account for 50% of the predicted probability mass.

1
Genome Medicine
183 papers in training set
Top 0.1%
11.6%
2
Nature Communications
5641 papers in training set
Top 19%
9.5%
3
Genome Research
468 papers in training set
Top 0.5%
8.7%
4
Human Genetics and Genomics Advances
84 papers in training set
Top 0.3%
5.4%
5
Genome Biology
637 papers in training set
Top 2%
5.3%
6
Scientific Reports
3612 papers in training set
Top 18%
5.3%
7
Genomics, Proteomics & Bioinformatics
172 papers in training set
Top 0.4%
4.7%
50% of probability mass above
8
Circulation: Genomic and Precision Medicine
48 papers in training set
Top 0.3%
3.2%
9
Human Genetics
28 papers in training set
Top 0.1%
3.1%
10
Journal of Genetics and Genomics
38 papers in training set
Top 0.1%
2.7%
11
Med
39 papers in training set
Top 0.1%
2.4%
12
Frontiers in Genetics
230 papers in training set
Top 2%
2.3%
13
Cell Genomics
172 papers in training set
Top 2%
2.3%
14
Cell
431 papers in training set
Top 6%
1.9%
15
Database
61 papers in training set
Top 0.5%
1.6%
16
PLOS Genetics
862 papers in training set
Top 8%
1.6%
17
Nucleic Acids Research
1281 papers in training set
Top 10%
1.5%
18
BMC Genomics
406 papers in training set
Top 5%
1.5%
19
Journal of Translational Medicine
57 papers in training set
Top 1%
1.1%
20
Communications Biology
993 papers in training set
Top 23%
1.1%
21
Briefings in Bioinformatics
354 papers in training set
Top 6%
1.1%
22
Nature Genetics
286 papers in training set
Top 4%
1.1%
23
npj Genomic Medicine
36 papers in training set
Top 0.6%
1.1%
24
The Innovation
13 papers in training set
Top 0.2%
1.0%
25
PLOS ONE
5266 papers in training set
Top 58%
1.0%
26
The American Journal of Human Genetics
234 papers in training set
Top 3%
1.0%
27
BMC Medical Genomics
50 papers in training set
Top 1%
1.0%
28
Proceedings of the National Academy of Sciences
2444 papers in training set
Top 40%
0.9%
29
Science China Life Sciences
29 papers in training set
Top 0.7%
0.8%
30
NAR Genomics and Bioinformatics
242 papers in training set
Top 5%
0.8%