Reinforcement learning with a verifiable reward (RLVR) offers a scalable approach to training language-model agents, yet sparse outcome rewards can leave ear…
机构:浙大
来源:arXiv 2609.39436 | AI4Papers 论文推荐平台