When a VLM answers a visual query, current interpretability tools rely on text rationales, which use a mismatched modality, or on internal read-outs, which o…
机构:KAUST
来源:arXiv 2609.35247 | AI4Papers 论文推荐平台