Group-based reinforcement learning (RL) methods, such as GRPO and its variants, have become a leading paradigm for training reasoning and agentic large langu…
机构:上交
来源:arXiv 2609.28963 | AI4Papers 论文推荐平台