Tree-structured reinforcement learning trains search agents by comparing alternative continuations and propagating terminal rewards to intermediate decisions…
机构:中科院
来源:arXiv 2609.34805 | AI4Papers 论文推荐平台