提出VLM-IE3D框架,通过隐式几何令牌(IGTs)和显式几何令牌(EGTs)从RGB视频中学习互补的3D表示,并利用3D适配器融合2D视觉线索,在3D视频检测、3D视觉定位、3D密集描述和空间推理等任务上取得优越性能。
机构:阿里
来源:arXiv 2607.21595 | AI4Papers 论文推荐平台