GEAR: Grounding Evidence-Aware Reward for Reducing Repetitive Copying in Long-Context LLMs
提出了GEAR方法,通过证据感知奖励塑造解决长上下文推理中模型的重复复制问题,在多个基准上提升平均4.6个点。
机构:北大
来源:
arXiv 2607.19345
|
AI4Papers 论文推荐平台