Latent visual reasoning (LVR) enables multimodal large language models (MLLMs) to perform intermediate computation in continuous latent tokens rather than ex…
机构:Amazon
来源:arXiv 2609.34563 | AI4Papers 论文推荐平台