Recent advances have enabled unified omni-modal models in understanding audio, vision, and language. However, existing benchmarks, training data, and learnin…
机构:阿里
来源:arXiv 2609.39490 | AI4Papers 论文推荐平台