返回全部动态
浙大IJCAI论文:自适应非对称适配器为CLIP微调踩刹车
原标题:别再乱调图像塔了!浙大 IJCAI 论文揭露 VLM 非对称性真相,给 CLIP 微调「踩刹车」
AI 摘要
浙江大学与斯旺西大学联合团队在IJCAI论文中提出自适应非对称适配器(Adaptive Asymmetric Adapter),用于CLIP模型微调。研究发现,在少样本迁移任务中,过度微调图像编码器会损害模型在域外数据上的泛化能力,而微调文本编码器收益更高。该方法通过动态路由器根据置信度自动调整图像分支的微调强度,在11个数据集上超越现有方法,为VLM高效落地提供了新思路。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
0 作者丨张 璐 编辑丨幸丽娟 在视觉语言大模型(VLM)落地少样本迁移任务时,高效参数微调(PEFT)是大家普遍采用的低成本方案。 然而,业界长期存在一个惯性思维:既然是做图像分类,给图像编码器多挂几个 Adapter、多做微调,模型理应能看懂更多视觉细节。 但现实却演化出一个尴尬的矛盾:在面对未知的现实场景(域外数据/OOD)时,在图像编码器上微调得越激进,模型的泛化能力反而破坏得越惨烈。 预训练大模型原本拥有一双看懂万物的“好眼睛”,强行局部微调反而把它“改近视了”。 这一矛盾引发了研究者的反思:在 VLM 微调中微调中,我们是否一定要死板地对称更新双塔?浙江大学陈静远教授课题组与斯旺西大学的联合团队提出了一个全新的方案——(自适应非对称适配器)。 它放弃了对图像分支的硬性微调,而是引入预测置信度,自动在合适的时候给视觉塔“踩刹车”,在保留预训练强泛化力的同时实现高效适配。 论文链接:https://arxiv.org/html/2605.13161v2 01 为了彻底搞清楚双塔到底该怎么调,研究团队在 11 个主流视觉数据集上展开了严谨的实验。他们给 CLIP 的图像塔和文本塔
发布时间:2026-08-17 12:45
抓取时间:2026-08-17 14:56
来源机构:雷峰网