Audio-visual large language models (AVLLMs) have made remarkable progress in multimodal understanding and reasoning through interactions among visual, audito…
机构:哈工大
来源:arXiv 2609.37568 | AI4Papers 论文推荐平台