Fully asynchronous reinforcement learning (RL) improves resource utilization in large language model post-training by overlapping rollout generation with pol…
机构:字节
来源:arXiv 2609.36830 | AI4Papers 论文推荐平台