On-policy distillation (OPD) trains a student on its own generated responses using token-level teacher supervision. However, uniform weighting overlooks diff…
机构:浙大
来源:arXiv 2610.11989 | AI4Papers 论文推荐平台