VIB-ICL:基于变分信息瓶颈的多模态上下文学习自适应注意力框架
原标题:Taming Visual Neglect: A Variational Information Bottleneck Framework for Adaptive Attention in Multimodal In-Context Learning
AI 摘要
本文提出VIB-ICL框架,基于信息瓶颈原理解释多模态上下文学习中视觉上下文何时有效或被忽视。作者引入跨模态信息增益(CMIG)量化视觉信息的额外贡献,并证明视觉忽视在信息冗余时是最优解。实验显示该方法在五个基准上提升准确率最高4.7%,并减少35%的演示需求。
正文节选
Taming Visual Neglect: A Variational Information Bottleneck Framework for Adaptive Attention in Multimodal In-Context Learning Abstract Large vision-language models exhibit strong in-context learning (ICL) capabilities, yet when and why visual context helps multimodal ICL remains poorly understood. Empirical studies show a puzzling dichotomy: models sometimes effectively leverage visual demonstrations, yet often neglect them entirely. We propose VIB-ICL, an information-theoretic framework that r