Back

Interpreting Rewards from Inverse Reinforcement Learning

Chow, J.; Yang, Y.; Laschowski, B.

2026-07-13 neuroscience
10.64898/2026.07.08.736783 bioRxiv
Show abstract

Inverse reinforcement learning can recover reward functions from observed behavior, but interpreting those rewards remains a fundamental challenge for understanding intelligent behavior and decision-making. To address this challenge, we introduce a novel framework for reward interpretation that combines reward-function analysis, latent mode assignments, and short-history behavioral analysis to infer latent motivations and behavioral dynamics. As a proof-of-concept, we instantiated the framework using switching inverse reinforcement learning on a large-scale dataset of multi-agent social interactions. Our framework interpreted the learned latent modes as cautious and volatile motivational profiles, demonstrating that recovered reward functions can reveal distinct patterns of behavioral dynamics. More broadly, these findings suggest that the proposed framework provides a promising approach for reverse-engineering and interpreting latent rewards underlying intelligent behavior and decision-making.

Matching journals

The top 5 journals account for 50% of the predicted probability mass.

1
PLOS Computational Biology
1863 papers in training set
Top 2%
15.2%
2
Nature Communications
5641 papers in training set
Top 12%
15.0%
3
Proceedings of the National Academy of Sciences
2444 papers in training set
Top 2%
12.0%
4
Scientific Reports
3612 papers in training set
Top 8%
7.3%
5
eLife
5828 papers in training set
Top 20%
5.6%
50% of probability mass above
6
Nature Human Behaviour
95 papers in training set
Top 0.4%
4.4%
7
PLOS ONE
5266 papers in training set
Top 39%
3.1%
8
Patterns
78 papers in training set
Top 0.7%
2.8%
9
Neuron
337 papers in training set
Top 3%
2.5%
10
Network Neuroscience
126 papers in training set
Top 0.7%
2.4%
11
Communications Psychology
22 papers in training set
Top 0.2%
1.7%
12
Nature Neuroscience
252 papers in training set
Top 3%
1.7%
13
Communications Medicine
113 papers in training set
Top 2%
1.7%
14
Science Advances
1243 papers in training set
Top 21%
1.5%
15
npj Digital Medicine
118 papers in training set
Top 2%
1.5%
16
Journal of The Royal Society Interface
235 papers in training set
Top 3%
1.3%
17
PNAS Nexus
159 papers in training set
Top 2%
1.1%
18
Frontiers in Computational Neuroscience
60 papers in training set
Top 1%
1.0%
19
Neural Computation
39 papers in training set
Top 0.7%
0.9%
20
iScience
1154 papers in training set
Top 34%
0.9%
21
IEEE Journal of Biomedical and Health Informatics
37 papers in training set
Top 1%
0.6%
22
Nature Computational Science
55 papers in training set
Top 2%
0.6%
23
Computational Psychiatry
12 papers in training set
Top 0.2%
0.6%
24
PRX Life
42 papers in training set
Top 1%
0.6%