Reward function design remains a bottleneck in reinforcement learning. While large language models (LLMs) have enabled automated reward generation, existing …
机构:清华
来源:arXiv 2608.18827 | AI4Papers 论文推荐平台