Multi-teacher on-policy distillation (M-OPD) has emerged as a promising paradigm for consolidating domain-specialized reinforcement learning (RL) experts int…
机构:清华
来源:arXiv 2608.19098 | AI4Papers 论文推荐平台