Pre-trained vision encoders contain layer-wise visual representations that differ in spatial granularity, semantic abstraction, and sensitivity to local deta…
机构:UIUC
来源:arXiv 2610.09440 | AI4Papers 论文推荐平台