On-policy self-distillation (OPSD) improves large language models by letting a self-teacher with privileged information provide dense token-level supervision…
机构:上海科技大学
来源:arXiv 2609.37132 | AI4Papers 论文推荐平台