On-policy distillation (OPD) transfers knowledge between language models through teacher supervision on student-generated trajectories. With different tokeni…
机构:上交
来源:arXiv 2609.34738 | AI4Papers 论文推荐平台