提出 MedObvious 基准,通过1880个任务评估视觉语言模型在临床分诊前的输入有效性验证能力(如模态、解剖、朝向一致性),发现现有17个VLM在预诊断合理性检查上表现不可靠,存在对正常输入误报异常、多图扩展性能下降、不同评测格式结果差异大等问题,表明该安全关键能力尚未解决。
机构:MBZUAI
来源:arXiv 2603.23501 | AI4Papers 论文推荐平台
AI4Papers 是一个以每日 arXiv 论文发现为入口的 AI 科研工作流平台,帮助研究者用最短时间掌握最新 AI/ML 前沿动态。
核心功能完全免费。高级 AI 功能(对比分析、深度研究、灵感工作台)支持自带兼容 API Key(如 OpenAI、通义千问)无限使用。
免费注册 | 使用教程