Reinforcement learning is crucial for improving large language models' reasoning and generalization. It relies on massive rollouts whose lengths become incre…
机构:上交
来源:arXiv 2610.09914 | AI4Papers 论文推荐平台