Back

A multi-view similarity network fusion framework for syndrome discovery from aggregated health records

Gomes Ferreira, A. P.; Anzel, A.; Tavares Veras Florentino, P.; Pereira Ramos, P. I.; Barral-Netto, M.; Marcilio, I.; Hattab, G.

2026-07-02 health informatics
10.64898/2026.06.30.26356975 medRxiv
Show abstract

Syndrome discovery, the identification of clinically meaningful groupings of signs and symptoms, is a foundational but labor-intensive task in syndromic surveillance, and the COVID-19 pandemic exposed the rigidity of expert-curated definitions in the face of novel threats. Unsupervised, data-driven methods are well-suited to this problem but remain underused. We propose an unsupervised framework based on Similarity Network Fusion (SNF) that operates on only five variables: diagnosis code, sex, age group, epidemiological week and year, and encounter count. Each diagnosis code was represented through three complementary views corresponding to the fundamental questions of syndromic surveillance: what condition is recorded (clinical, via SapBERT embeddings), who is affected (demographic, via chi-square distances), and when it occurs (temporal, via Move-Split-Merge). The fused affinity matrix is partitioned by spectral clustering and exported directly in the Open Syndrome Definition (OSD) format for downstream integration. To our knowledge, this is the first framework of SNF applied to the task of syndrome discovery. We use the framework in 72.9 million primary care encounters across ten Brazilian municipalities. Treating each city as an experiment with no shared training signal yields 47 candidate syndromes, 72% of which are rated fully valid by an expert blind to the procedure. By requiring no predefined targets, the framework discovers candidate syndromes at scale, including ones never explicitly sought, and emits them in a deployable format, shortening the path from emerging signal to usable definition.

Matching journals

The top 6 journals account for 50% of the predicted probability mass.

1
Nature Medicine
125 papers in training set
Top 0.1%
22.0%
2
IEEE Journal of Biomedical and Health Informatics
37 papers in training set
Top 0.1%
7.9%
3
npj Digital Medicine
118 papers in training set
Top 0.9%
6.3%
4
Nature Communications
5641 papers in training set
Top 27%
5.5%
5
JMIR Medical Informatics
18 papers in training set
Top 0.1%
4.9%
6
Patterns
78 papers in training set
Top 0.3%
4.9%
50% of probability mass above
7
Artificial Intelligence in Medicine
17 papers in training set
Top 0.1%
4.3%
8
Scientific Reports
3612 papers in training set
Top 29%
3.5%
9
Communications Medicine
113 papers in training set
Top 0.8%
3.5%
10
The Lancet Digital Health
25 papers in training set
Top 0.2%
2.5%
11
JAMIA Open
42 papers in training set
Top 0.7%
2.4%
12
PLOS ONE
5266 papers in training set
Top 43%
2.4%
13
Bioinformatics
1204 papers in training set
Top 6%
2.4%
14
PLOS Digital Health
106 papers in training set
Top 2%
1.7%
15
BMC Medical Informatics and Decision Making
43 papers in training set
Top 1%
1.7%
16
Science Advances
1243 papers in training set
Top 20%
1.7%
17
Journal of Medical Internet Research
87 papers in training set
Top 2%
1.1%
18
Journal of Biomedical Informatics
47 papers in training set
Top 0.9%
1.1%
19
Nature Machine Intelligence
70 papers in training set
Top 2%
1.1%
20
iScience
1154 papers in training set
Top 29%
1.0%
21
Frontiers in Psychiatry
87 papers in training set
Top 2%
1.0%
22
Nature Computational Science
55 papers in training set
Top 2%
0.8%
23
Briefings in Bioinformatics
354 papers in training set
Top 7%
0.8%
24
Biology Methods and Protocols
61 papers in training set
Top 2%
0.8%
25
Wellcome Open Research
67 papers in training set
Top 2%
0.6%
26
IEEE Access
35 papers in training set
Top 2%
0.6%
27
International Journal of Medical Informatics
26 papers in training set
Top 2%
0.6%
28
BMC Bioinformatics
457 papers in training set
Top 6%
0.6%
29
BMC Medical Research Methodology
47 papers in training set
Top 2%
0.6%
30
Frontiers in Digital Health
24 papers in training set
Top 2%
0.6%