Improving joint audio-visual reasoning in Omni Large Language Models typically incurs substantial data construction and training costs. Our diagnostics revea…
机构:上交
来源:arXiv 2610.02819 | AI4Papers 论文推荐平台