Multimodal large language models (MLLMs) combine linguistic reasoning with visual perception, yet their ability to perform visual spatial planning under expl…
机构:北大
来源:arXiv 2608.20237 | AI4Papers 论文推荐平台