Vision-language models (VLMs) have demonstrated impressive capabilities but suffer from substantial computational overhead, as vision tokens dominate the inp…
机构:阿里
来源:arXiv 2610.11251 | AI4Papers 论文推荐平台