Back

Input design for unsupervised cross-national branded food database alignment using large language models

Nakagawa, S.; Yamamoto, A.

2026-05-25 nutrition
10.64898/2026.05.23.26353945 medRxiv
Show abstract

Cross-national alignment of branded food databases is essential for international nutritional epidemiology but lacks standardized methods. Existing approaches - including food ontologies, domain-specific fine-tuned language models, and manual expert mapping - require either substantial infrastructure or do not scale to thousands of items. We propose an unsupervised evaluation framework for large language model (LLM)-based food database alignment that requires no ground-truth labels. Using the Japan Branded Food Database (JBFD; 9,519 items, 71 mid-level categories) and USDA FoodData Central (448 categories) as a case study, we introduce two complementary metrics: weighted centroid distance (nutritional proximity between matched category pairs) and dominant category share (structural consistency of category-level assignments). We then conducted a systematic ablation study across eight input conditions (A-H), varying combinations of product name, nutrient profile, and semantic category label. Results showed that nutrient-only inputs yielded poor structural consistency despite low centroid distances, while semantic category labels achieved the highest dominant category share (89.3%) but introduced circularity due to their LLM-derived origin. Among circularity-free conditions, product name combined with minimal nutrient information (energy, protein, salt; condition E) achieved the best balance of centroid distance (0.471) and dominant category share (65.8%). Model comparison across Claude Haiku, Sonnet, and Opus confirmed that NO_MATCH rates were consistent across model sizes (12-14%), suggesting that prompt design contributes more to alignment quality than model scale. These findings provide practical guidance for input design in LLM-based food database alignment without ground-truth annotation.Sonnet 4.6

Matching journals

The top 10 journals account for 50% of the predicted probability mass.

1
PLOS ONE
5266 papers in training set
Top 12%
15.6%
2
BMC Medical Informatics and Decision Making
43 papers in training set
Top 0.2%
8.2%
3
GigaScience
212 papers in training set
Top 0.5%
5.7%
4
Scientific Reports
3612 papers in training set
Top 22%
4.5%
5
Healthcare
17 papers in training set
Top 0.1%
3.4%
6
Scientific Data
209 papers in training set
Top 0.7%
3.3%
7
Frontiers in Public Health
148 papers in training set
Top 2%
3.3%
8
Public Health Nutrition
15 papers in training set
Top 0.2%
2.7%
9
Journal of Dairy Science
13 papers in training set
Top 0.1%
2.5%
10
Nature Communications
5641 papers in training set
Top 39%
2.5%
50% of probability mass above
11
Journal of Translational Medicine
57 papers in training set
Top 0.4%
2.5%
12
Bioinformatics
1204 papers in training set
Top 6%
2.5%
13
Statistics in Medicine
40 papers in training set
Top 0.3%
2.2%
14
Current Developments in Nutrition
15 papers in training set
Top 0.3%
2.0%
15
Epidemics
116 papers in training set
Top 1%
2.0%
16
Frontiers in Nutrition
24 papers in training set
Top 0.4%
1.8%
17
Bioinformatics Advances
203 papers in training set
Top 3%
1.8%
18
Computational and Structural Biotechnology Journal
242 papers in training set
Top 4%
1.6%
19
The Journal of Nutrition
25 papers in training set
Top 0.3%
1.6%
20
Ecological Informatics
33 papers in training set
Top 0.5%
1.2%
21
Database
61 papers in training set
Top 0.6%
1.2%
22
PLOS Global Public Health
344 papers in training set
Top 7%
1.1%
23
Wellcome Open Research
67 papers in training set
Top 1%
0.9%
24
Methods in Ecology and Evolution
176 papers in training set
Top 2%
0.9%
25
Frontiers in Bioinformatics
49 papers in training set
Top 1%
0.9%
26
iScience
1154 papers in training set
Top 33%
0.9%
27
Communications Medicine
113 papers in training set
Top 5%
0.6%
28
PLOS Computational Biology
1863 papers in training set
Top 21%
0.6%
29
The American Journal of Clinical Nutrition
19 papers in training set
Top 0.3%
0.6%
30
Quantitative Plant Biology
15 papers in training set
Top 0.3%
0.6%