返回全部动态

VIB-ICL:基于变分信息瓶颈的多模态上下文学习自适应注意力框架

原标题:Taming Visual Neglect: A Variational Information Bottleneck Framework for Adaptive Attention in Multimodal In-Context Learning

arXiv cs.CL一手来源研究质量 87

AI 摘要

本文提出VIB-ICL框架,基于信息瓶颈原理解释多模态上下文学习中视觉上下文何时有效或被忽视。作者引入跨模态信息增益(CMIG)量化视觉信息的额外贡献,并证明视觉忽视在信息冗余时是最优解。实验显示该方法在五个基准上提升准确率最高4.7%,并减少35%的演示需求。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

Taming Visual Neglect: A Variational Information Bottleneck Framework for Adaptive Attention in Multimodal In-Context Learning Abstract Large vision-language models exhibit strong in-context learning (ICL) capabilities, yet when and why visual context helps multimodal ICL remains poorly understood. Empirical studies show a puzzling dichotomy: models sometimes effectively leverage visual demonstrations, yet often neglect them entirely. We propose VIB-ICL, an information-theoretic framework that r


发布时间:2026-08-26 12:00
抓取时间:2026-08-26 12:11
来源机构:arXiv
阅读原文arxiv.org