Rubric-based reinforcement learning extends reward-driven optimization to open-ended tasks by assigning partial credit to individual response requirements. H…
机构:NTU
来源:arXiv 2610.02824 | AI4Papers 论文推荐平台