Effective multi-turn agents require interaction strategies that coordinate information gathering, actions, and feedback over long horizons. GRPO is a reinfor…
机构:哈工大
来源:arXiv 2609.35058 | AI4Papers 论文推荐平台