On-policy distillation (OPD) trains a student language model with dense feedback from a stronger teacher on student-generated trajectories. Yet standard OPD …
机构:港大
来源:arXiv 2609.35517 | AI4Papers 论文推荐平台