Back

SEMFA: A General Framework for Inferring Statistical Significance of Mahalanobis Similarity between Multi-Omics Profiled Samples Built on Multiple Factor Analysis

Han, J.; Luo, W.; Baldwin, E.; Zhang, H. H.; An, L.; Liu, J.; Li, H.

2026-06-24 bioinformatics
10.64898/2026.06.18.733287 bioRxiv
Show abstract

MotivationWith rapid advances in sequencing technologies, many heterogeneous omics datasets have been generated, as seen in the Encyclopedia of DNA Elements (ENCODE) and many single-cell multi-omics sequencing projects, bringing substantial challenges to existing integrative methods. In this article, we report a novel multi-omics fusion and analysis software SEMFA which performs general parametric tests for the Mahalanobis Similarity of samples based on the factor scores generated by an Extended version of conventional Multiple Factor Analysis. ResultsOur developed method is effective and robust under both Gaussian and non-Gaussian assumptions. The mean F1 scores are over 0.8 when the column similarity level is 0.9 and the noise level ranges between 0.1 and 0.2, using simulation studies based on ENCODE count data. It was also efficient and effective at handling large-scale single-cell multi-omics data, as demonstrated in colon cancer cases as it unveiled signature network organization patterns of cells for stages III and IV.

Matching journals

The top 3 journals account for 50% of the predicted probability mass.

1
BMC Bioinformatics
457 papers in training set
Top 0.1%
30.4%
2
Briefings in Bioinformatics
354 papers in training set
Top 0.5%
10.4%
3
GigaScience
212 papers in training set
Top 0.2%
9.6%
50% of probability mass above
4
Bioinformatics
1204 papers in training set
Top 3%
9.5%
5
Molecular & Cellular Proteomics
25 papers in training set
Top 0.1%
3.4%
6
PLOS Computational Biology
1863 papers in training set
Top 9%
3.4%
7
BMC Genomics
406 papers in training set
Top 2%
3.1%
8
PLOS ONE
5266 papers in training set
Top 39%
3.1%
9
Computational and Structural Biotechnology Journal
242 papers in training set
Top 2%
2.7%
10
Bioinformatics Advances
203 papers in training set
Top 2%
2.3%
11
Journal of Computational Biology
48 papers in training set
Top 0.4%
2.3%
12
Genes
144 papers in training set
Top 1%
2.1%
13
Scientific Reports
3612 papers in training set
Top 49%
2.1%
14
Nucleic Acids Research
1281 papers in training set
Top 9%
1.7%
15
BioData Mining
22 papers in training set
Top 0.5%
1.1%
16
Frontiers in Genetics
230 papers in training set
Top 4%
1.1%
17
IEEE Journal of Biomedical and Health Informatics
37 papers in training set
Top 1%
1.0%
18
npj Systems Biology and Applications
125 papers in training set
Top 2%
0.8%
19
Genome Biology
637 papers in training set
Top 9%
0.8%
20
International Journal of Molecular Sciences
494 papers in training set
Top 16%
0.8%
21
Nature Communications
5641 papers in training set
Top 58%
0.8%
22
NAR Genomics and Bioinformatics
242 papers in training set
Top 5%
0.8%