Layer-wise visual-text similarity in Multimodal Large Language Models (MLLMs) is widely interpreted as evidence that the language model progressively integra…
机构:中科大
来源:arXiv 2609.30210 | AI4Papers 论文推荐平台