While reinforcement learning with verifiable rewards provides reliable outcome supervision for VideoLLMs, sequence-level rewards offer limited token-level gu…
机构:中国电信
来源:arXiv 2610.06342 | AI4Papers 论文推荐平台