A key challenge for multimodal large language models (MLLMs) is moving beyond visual recognition to constraint-aware cross-modal reasoning. This involves com…
机构:阿里
来源:arXiv 2610.10374 | AI4Papers 论文推荐平台