本文系统研究了在预训练策略基础上预训练Q函数对在线RL微调的影响,发现朴素预训练帮助不大,并提出通过训练多个不同策略并使用其混合轨迹来引导Q函数学习的方法(IPE),在连续控制任务上平均提升26%。
机构:Stanford
来源:arXiv 2607.27203 | AI4Papers 论文推荐平台