On-policy distillation (OPD) is a promising approach for training language agents, providing dense teacher supervision on student-generated trajectories. How…
机构:NVIDIA
来源:arXiv 2609.40285 | AI4Papers 论文推荐平台