On-policy learning has been argued to reduce catastrophic forgetting, produce sparser parameter updates, and improve generalisation. However, existing compar…
机构:剑桥
来源:arXiv 2609.35259 | AI4Papers 论文推荐平台