
别再乱调图像塔了!浙大 IJCAI 论文揭露 VLM 非对称性真相,给 CLIP 微调「踩刹车」
浙江大学在 IJCAI 发表论文,指出对 CLIP 等视觉语言大模型(VLM)的图像编码器过度微调会损害泛化能力,并提出 A3B2 自适应非对称适配器优化策略。
资讯解读
视觉语言大模型在少样本迁移任务中常采用高效参数微调方案。然而,业界普遍存在一种惯性思维,认为增加图像编码器的微调参数能提升模型对视觉细节的捕捉能力。
浙江大学的研究团队在 IJCAI 会议上发表的最新论文揭示了这一做法的潜在风险。研究发现,在图像编码器上进行过于激进的微调,反而会严重破坏模型在面对未知现实场景时的泛化能力,导致预训练模型原有的强大感知能力下降。
针对这一问题,研究者提出了 A3B2 自适应非对称适配器。该方法旨在通过更克制的微调策略,平衡模型在特定任务上的性能与在域外数据上的泛化表现,为视觉语言大模型的落地应用提供了新的技术参考。
本站展示内容为基于公开信息的资讯解读与整理,不代表原文转载。如需核实细节或获取完整报道,请通过下方链接访问原始来源。