Vision-language models (VLMs) face a fixed-budget trade-off between processing more visual information for fine-grained perception and using a larger languag…
机构:南大
来源:arXiv 2610.01640 | AI4Papers 论文推荐平台