When training large language models with reinforcement learning, terminal rewards provide little guidance about which steps matter. Common methods for assign…
机构:UIUC
来源:arXiv 2610.01207 | AI4Papers 论文推荐平台