Reinforcement learning (RL) is widely used to sharpen reasoning in multimodal large language models (MLLMs), yet its effect on hallucination is uneven. We tr…
机构:浙大
来源:arXiv 2609.28570 | AI4Papers 论文推荐平台