Back

GR-SAFS: A Graph-Regularized Stacking Framework with Adaptive Feature Selection for High-Dimensional Prognostic Biomarker Discovery

He, J.; Guan, J.

2026-06-28 bioinformatics
10.64898/2026.06.23.733986 bioRxiv
Show abstract

Identifying prognostic biomarkers from high-dimensional transcriptomic data poses a triple challenge: achieving sparsity, preserving biological network topology, and integrating complementary nonlinear signals. Existing methods typically ignore network structure, miss nonlinear interactions, or lack a principled mechanism to fuse heterogeneous model outputs. We introduce GR-SAFS (Graph-Regularized Stacking with Adaptive Feature Selection), a framework with three modules: a Graph-Lasso engine embedding gene co-expression network Laplacian priors, run in parallel with a Random Forest engine; an empirical cumulative distribution function (eCDF) alignment layer that places sparse and dense importances on a common percentile scale; and a diversity-penalized quadratic programming router whose strict convexity yields a unique global optimum. On the TCGA-LUAD cohort, GR-SAFS identifies a 20-gene signature with a training concordance index of 0.700. Across two independent crossplatform microarray cohorts, GR-SAFS is the only method whose frozen signature retains statistically significant risk stratification in every cohort, where stronger-C-index baselines lose significance on at least one external cohort. Functional enrichment anchors the signature to a coherent Wnt/{beta};-catenin axis. An open-source implementation is released for full reproducibility.

Matching journals

The top 6 journals account for 50% of the predicted probability mass.

1
Bioinformatics
1204 papers in training set
Top 1%
18.5%
2
Nature Communications
5641 papers in training set
Top 18%
9.8%
3
Cell Systems
201 papers in training set
Top 0.4%
7.9%
4
Briefings in Bioinformatics
354 papers in training set
Top 1%
6.7%
5
Nature Methods
385 papers in training set
Top 2%
5.5%
6
Patterns
78 papers in training set
Top 0.5%
3.5%
50% of probability mass above
7
Bioinformatics Advances
203 papers in training set
Top 2%
3.2%
8
PLOS Computational Biology
1863 papers in training set
Top 11%
2.6%
9
Genome Biology
637 papers in training set
Top 4%
2.4%
10
Scientific Reports
3612 papers in training set
Top 44%
2.4%
11
Nature Machine Intelligence
70 papers in training set
Top 1%
2.4%
12
PLOS ONE
5266 papers in training set
Top 45%
2.1%
13
BMC Bioinformatics
457 papers in training set
Top 4%
1.7%
14
npj Digital Medicine
118 papers in training set
Top 2%
1.5%
15
Communications Biology
993 papers in training set
Top 17%
1.5%
16
IEEE Transactions on Computational Biology and Bioinformatics
20 papers in training set
Top 0.3%
1.5%
17
Nucleic Acids Research
1281 papers in training set
Top 10%
1.4%
18
BioData Mining
22 papers in training set
Top 0.4%
1.3%
19
npj Systems Biology and Applications
125 papers in training set
Top 1%
1.1%
20
Medical Image Analysis
35 papers in training set
Top 0.5%
1.1%
21
Cell Reports Methods
165 papers in training set
Top 3%
1.0%
22
NAR Genomics and Bioinformatics
242 papers in training set
Top 4%
1.0%
23
GigaScience
212 papers in training set
Top 4%
0.9%
24
IEEE/ACM Transactions on Computational Biology and Bioinformatics
38 papers in training set
Top 1%
0.8%
25
BMC Genomics
406 papers in training set
Top 8%
0.8%
26
Biostatistics
24 papers in training set
Top 0.3%
0.8%
27
IEEE Journal of Biomedical and Health Informatics
37 papers in training set
Top 1%
0.8%
28
Genome Medicine
183 papers in training set
Top 5%
0.8%
29
Nature Biotechnology
172 papers in training set
Top 4%
0.8%
30
JCO Clinical Cancer Informatics
22 papers in training set
Top 0.8%
0.6%