Back

Bridging Acoustic and Semantic Spaces for Interpretable Voice Scoring via Zero-Shot Semantic Expansion

Hsiao, C.; Cheng, Y.-R.; Yang, C.-Y.; Hsu, F.-S.

2026-06-01 health informatics
10.64898/2026.05.29.26354442 medRxiv
Show abstract

Subjective auditory-perceptual evaluation and uninterpretable deep learning models limit the clinical assessment of voice disorders. This study proposes a two-phase zero-shot framework to evaluate voice pathology. First, an Audio Spectrogram Transformer is fine-tuned on the Perceptual Voice Quality Database to generate an acoustic latent space. Second, Orthogonal Procrustes analysis maps these acoustic embeddings directly onto the semantic space of a pre-trained Sentence Transformer. The geometric alignment produced continuous semantic axes that outperformed a supervised machine learning baseline in regressing clinician-rated GRBAS (Grade, Roughness, Breathiness, Asthenia, and Strain) severity scales. Furthermore, these axes correlate with traditional acoustic measures, including Harmonics-to-Noise Ratio and local jitter, while remaining robust when applied to aperiodic signals by not requiring fundamental frequency extraction. Most importantly, the model achieved zero-shot semantic expansion, successfully evaluating voices using an untrained, natural clinical vocabulary beyond the GRBAS scale. External validation on the Voice ICarus Database confirmed cross-corpus stability and demonstrated the capacity for zero-shot differential phenotyping of specific etiologies, such as hypokinetic dysphonia and reflux laryngitis. By bridging acoustic and semantic latent spaces, this framework offers an objective, continuous, and transparent metric for evaluating voice quality using voice descriptive vocabulary.

Matching journals

The top 5 journals account for 50% of the predicted probability mass.

1
IEEE Journal of Biomedical and Health Informatics
37 papers in training set
Top 0.1%
19.2%
2
Scientific Reports
3612 papers in training set
Top 0.5%
19.2%
3
npj Digital Medicine
118 papers in training set
Top 0.8%
7.0%
4
PLOS ONE
5266 papers in training set
Top 32%
4.5%
5
Nature Machine Intelligence
70 papers in training set
Top 0.6%
4.2%
50% of probability mass above
6
Frontiers in Neuroscience
256 papers in training set
Top 1%
3.6%
7
Biomedical Signal Processing and Control
22 papers in training set
Top 0.2%
2.9%
8
Nature Communications
5641 papers in training set
Top 39%
2.5%
9
Journal of Neural Engineering
221 papers in training set
Top 1%
2.5%
10
Journal of Medical Internet Research
87 papers in training set
Top 1%
2.2%
11
Computers in Biology and Medicine
128 papers in training set
Top 2%
2.0%
12
Advanced Science
286 papers in training set
Top 4%
2.0%
13
Patterns
78 papers in training set
Top 1%
1.8%
14
IEEE Transactions on Neural Systems and Rehabilitation Engineering
49 papers in training set
Top 0.5%
1.8%
15
Artificial Intelligence in Medicine
17 papers in training set
Top 0.3%
1.7%
16
eBioMedicine
183 papers in training set
Top 3%
1.5%
17
Science Advances
1243 papers in training set
Top 24%
1.2%
18
PLOS Digital Health
106 papers in training set
Top 3%
1.2%
19
Cell Reports Medicine
153 papers in training set
Top 4%
1.0%
20
CHEST
14 papers in training set
Top 0.3%
0.9%
21
Nature Medicine
125 papers in training set
Top 3%
0.9%
22
Frontiers in Digital Health
24 papers in training set
Top 1%
0.9%
23
eLife
5828 papers in training set
Top 63%
0.9%
24
Sensors
43 papers in training set
Top 1%
0.6%
25
Communications Medicine
113 papers in training set
Top 5%
0.6%
26
IEEE Transactions on Biomedical Engineering
40 papers in training set
Top 1%
0.6%
27
Communications Biology
993 papers in training set
Top 33%
0.6%
28
PLOS Computational Biology
1863 papers in training set
Top 23%
0.5%
29
IEEE Access
35 papers in training set
Top 2%
0.5%