Language models are moving beyond generating answers to pursuing long-horizon goals in interactive environments. Post-training these agents requires long, he…
机构:Stanford
来源:arXiv 2610.05935 | AI4Papers 论文推荐平台