Reinforcement learning for long-horizon agents typically relies on sparse outcome-based rewards. This leads to a severe cold-start problem, as early-stage po…
机构:快手
来源:arXiv 2609.37898 | AI4Papers 论文推荐平台