Back

Defining Pseudo-Haplotype Analysis Reveals Multi-Gene Genetic Pattern Across BAF Chromatin Remodeling Complexes

Dong, X.; Haque, N.; Wagenknecht, J.; Zimmermann, M. T.

2026-06-26 bioinformatics
10.64898/2026.06.22.732952 bioRxiv
Show abstract

BRG1-associated factor (BAF) is a crucial chromatin remodeling complex. Variants in genes encoding BAF complex components cause human diseases, including cancers and developmental disorders. However, the genetic diversity and variant co-occurrence patterns within BAF genes remain incompletely understood. It is feasible, though largely untested, that rare patterns of common variations could alter function similarly to rare deleterious variants. Further, there is no modern census of how often individual people simultaneously carry multiple rare and common variations, nor means for genomics practitioners to assess their combined effects. Approaches are needed to characterize complete sequences from individual samples. In this study, we introduce a pseudo-haplotype analysis (PHA) framework, combining multiple protein-coding sequence variants, observed concurrently within individual samples, into discrete BAF patterns. In this cohort, 78.44% of pseudo-haplotype (PH) copies carry at least one BAF coding variation. Among these, 56.18% contain at least two distinct variants, and 32.39% contain three or more, indicating a substantial burden of multi-variant configurations across individuals. Notably, 25.30% of unique PHs are observed only once, highlighting a considerable proportion of people who are affected by rare or private combinations of genetic variations. We identify multiple significant (FDR < 0.05) co-occurrence combinations across global populations. These findings underscore the importance of considering population-specific genetic structures, and complete individual variant configurations when investigating disease associations and genetic mechanisms. Our approach provides a generalizable framework for characterizing multi-variant architectures within chromatin remodeling genes at a population scale, with potential applications in elucidating disease etiology and advancing precision medicine.

Matching journals

The top 9 journals account for 50% of the predicted probability mass.

1
The American Journal of Human Genetics
234 papers in training set
Top 0.6%
7.6%
2
Nature Communications
5641 papers in training set
Top 22%
7.6%
3
NAR Genomics and Bioinformatics
242 papers in training set
Top 0.5%
6.5%
4
BMC Genomics
406 papers in training set
Top 0.8%
6.5%
5
Nucleic Acids Research
1281 papers in training set
Top 3%
6.1%
6
PLOS Genetics
862 papers in training set
Top 2%
5.3%
7
Genome Biology
637 papers in training set
Top 2%
5.0%
8
Epigenetics & Chromatin
10 papers in training set
Top 0.1%
4.2%
9
PLOS Computational Biology
1863 papers in training set
Top 9%
3.9%
50% of probability mass above
10
Scientific Reports
3612 papers in training set
Top 28%
3.9%
11
Frontiers in Genetics
230 papers in training set
Top 1%
3.3%
12
Genome Research
468 papers in training set
Top 2%
3.1%
13
Computational and Structural Biotechnology Journal
242 papers in training set
Top 2%
2.6%
14
PLOS ONE
5266 papers in training set
Top 44%
2.3%
15
Human Genetics and Genomics Advances
84 papers in training set
Top 0.9%
2.3%
16
Bioinformatics
1204 papers in training set
Top 6%
2.3%
17
Communications Biology
993 papers in training set
Top 11%
2.1%
18
Genes
144 papers in training set
Top 2%
1.7%
19
Proceedings of the National Academy of Sciences
2444 papers in training set
Top 30%
1.6%
20
Briefings in Bioinformatics
354 papers in training set
Top 5%
1.4%
21
eLife
5828 papers in training set
Top 55%
1.3%
22
GigaScience
212 papers in training set
Top 4%
1.1%
23
Cell Genomics
172 papers in training set
Top 3%
1.1%
24
GENETICS
483 papers in training set
Top 4%
1.1%
25
Nature Genetics
286 papers in training set
Top 4%
1.0%
26
Molecular Biology and Evolution
542 papers in training set
Top 4%
1.0%
27
European Journal of Human Genetics
58 papers in training set
Top 1.0%
1.0%
28
Genome Medicine
183 papers in training set
Top 5%
0.8%
29
Human Molecular Genetics
141 papers in training set
Top 3%
0.8%
30
Advanced Science
286 papers in training set
Top 12%
0.6%