Evaluating vision encoders requires metrics that reliably predict their downstream performance in multimodal large language models (MLLMs). Although recent s…
机构:上交
来源:arXiv 2610.05413 | AI4Papers 论文推荐平台