Agentic reinforcement learning (RL) has emerged as a powerful approach for training large language model agents on multi-step tasks, yet reliance on terminal…
机构:阿里
来源:arXiv 2610.01161 | AI4Papers 论文推荐平台