Asynchronous RL accelerates large language model post-training by decoupling rollout generation from optimization, but trains on stale trajectories. Existing…
机构:复旦
来源:arXiv 2610.09597 | AI4Papers 论文推荐平台