Multimodal large language models learn mostly from paired image-text data or annotated video, and raw web video is rarely used to further train an existing l…
机构:Meta
来源:arXiv 2610.11019 | AI4Papers 论文推荐平台