Spatial reasoning remains a persistent weakness of vision-language models (VLMs), because RGB inputs do not directly provide geometric evidence. Existing rem…
机构:浙大
来源:arXiv 2610.12355 | AI4Papers 论文推荐平台