Back

Revisiting CPUs for Protein Folding: Xeon-Based Acceleration of AlphaFold2

Chaudhary, N.; Yang, W.; Kalamkar, D.; Zhou, J.; Ghosh, S.; Xia, L.; Tiwari, M.; Heinecke, A.; Kaul, B.; Misra, S.

2026-05-29 genomics
10.64898/2026.05.27.728222 bioRxiv
Show abstract

Protein structure prediction via AlphaFold2 has revolutionized drug discovery, yet its end-to-end execution remains computationally intensive. While GPUs are traditionally favored for deep learning, the AlphaFold2 algorithm consists of heterogeneous phases -- preprocessing with sparse database searches and model inference with low-arithmetic-intensity attention modules -- that present unique architectural challenges. In this work, we address these bottlenecks by introducing Open-Omics-AlphaFold2, a highly optimized implementation for Intel(R) Xeon(R) CPU. By leveraging the CPUs versatility in handling both sparse preprocessing algorithms and dense matrix operations via Intel Advanced Matrix Extensions (AMX), we accelerate the entire pipeline end-to-end. Our optimization strategy employs multi-level parallelism -- spanning multiprocessing, multi-threading, and vectorization -- alongside cacheaware tiling and operator fusion. Our results demonstrate that, on a Xeon CPU, Open-Omics-AlphaFold2 achieves 2 7.58 speedup for preprocessing and 19.8 29.2 speedup for model inference over baseline Deepmind-AlphaFold2. Moreover, for a proteome of 391 proteins, Open-Omics-AlphaFold2 running on a dual-socket Intel Xeon 6980P system achieves a remarkable 76% higher through-put over the state-of-the-art GPU-accelerated solution, FastFold, running on a single-socket Intel Xeon 6980P CPU with an NVIDIA H100 offioad. Code availabilityBaremetal: https://github.com/IntelLabs/open-omics-alphafold Containerized: https://github.com/IntelLabs/Open-Omics-Accelera tion-Framework/tree/main/pipelines/alphafold2-based-protein-folding

Matching journals

The top 6 journals account for 50% of the predicted probability mass.

1
Bioinformatics
1204 papers in training set
Top 0.9%
22.5%
2
Nature Methods
385 papers in training set
Top 1%
9.0%
3
Nature Communications
5641 papers in training set
Top 23%
6.8%
4
GigaScience
212 papers in training set
Top 0.5%
5.5%
5
BMC Bioinformatics
457 papers in training set
Top 2%
5.5%
6
Bioinformatics Advances
203 papers in training set
Top 1%
5.2%
50% of probability mass above
7
Communications Biology
993 papers in training set
Top 3%
4.1%
8
Genome Biology
637 papers in training set
Top 3%
3.2%
9
Nature Computational Science
55 papers in training set
Top 0.2%
3.2%
10
Artificial Intelligence in the Life Sciences
13 papers in training set
Top 0.1%
2.8%
11
Nature Machine Intelligence
70 papers in training set
Top 1%
2.7%
12
Scientific Reports
3612 papers in training set
Top 42%
2.5%
13
PLOS Computational Biology
1863 papers in training set
Top 12%
2.5%
14
Genome Research
468 papers in training set
Top 3%
2.4%
15
Frontiers in Genetics
230 papers in training set
Top 3%
1.3%
16
NAR Genomics and Bioinformatics
242 papers in training set
Top 3%
1.3%
17
Computational and Structural Biotechnology Journal
242 papers in training set
Top 5%
1.1%
18
iScience
1154 papers in training set
Top 25%
1.1%
19
Briefings in Bioinformatics
354 papers in training set
Top 6%
1.1%
20
Cell Systems
201 papers in training set
Top 4%
1.0%
21
PLOS ONE
5266 papers in training set
Top 59%
0.9%
22
Nature Biotechnology
172 papers in training set
Top 4%
0.9%
23
Journal of Chemical Information and Modeling
238 papers in training set
Top 3%
0.6%
24
Cell Reports
1498 papers in training set
Top 29%
0.6%
25
Journal of Molecular Biology
232 papers in training set
Top 4%
0.6%
26
Cell Reports Methods
165 papers in training set
Top 4%
0.6%