提出 Relay-OPD,通过检测 student 推理失败点并让 teacher 短暂接管纠正,在8个数学推理基准上超越标准 OPD 和 FastOPD,平均提升5.73%和1.49%,训练轨迹长度减少超过50%。
机构:阿里
来源:arXiv 2607.26057 | AI4Papers 论文推荐平台