返回全部动态
紫东太初推出GMC剪枝法:减80%Token仍保多模态能力
原标题:紫东太初推出GMC核心集剪枝方法,少80%Token仍满血保真多模态能力
AI 摘要
中国科学院自动化研究所紫东太初大模型团队提出核心集剪枝方法GMC,通过互补证据自适应筛选与群体互补信息传输双阶段架构,在免训练、无额外依赖的情况下压缩视觉Token。实验表明,在Qwen2.5-VL-7B上减少80% Token仍保留97.78%能力,在LLaVA-1.5-7B上性能几乎无损,并减少KV Cache占用,提升推理速度。该方法可兼容主流视觉语言模型,抑制视觉幻觉,为多模态模型高效部署提供新范式。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
紫东太初推出GMC核心集剪枝方法,少80%Token仍满血保真多模态能力 免训练、开箱即用! 允中 发自 凹非寺 量子位 | 公众号 QbitAI 随着视觉语言模型分辨率与图文理解能力持续升级,图像会被编码为数百至上万个视觉Token。 大量Token持续参与解码计算、长期占用KV Cache,带来显存开销大、推理速度慢、部署成本高等一系列问题,视觉Token冗余已成为多模态模型高效推理与规模化落地的核心瓶颈。 当前行业通用方案为传统Top‑K Token筛选:对每个Token独立打分,仅保留得分最高的部分样本。 但该方法存在明显缺陷:高分Token高度集中在画面显著区域,反复保留同质化冗余信息,极易遗漏文字、数字、坐标轴、目标空间关系等分散但关键的互补证据; 同时低分Token被直接删除,携带细节信息永久丢失,导致模型推理失真、事实判断偏差、视觉幻觉增多,普遍存在「压缩必掉精度」的行业难题。 针对以上痛点,中国科学院自动化研究所紫东太初大模型团队,提出核心集剪枝方法GMC(Grounded Message Coreset Pruning),实现了技术跨越式创新。 GMC彻底跳出「筛选
发布时间:2026-08-12 18:54
抓取时间:2026-08-12 19:49
来源机构:量子位