3DZip:面向3D问答的空间感知特征多样性引导令牌压缩
原标题:3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering
AI 摘要
Hugging Face 每日论文发布了一篇题为《3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering》的研究论文。该论文提出了一种名为3DZip的三阶段令牌压缩框架,用于3D视觉语言模型,通过粗体素化、基于特征多样性的锚点选择以及空间约束合并,有效减少3D问答中的令牌数量。实验表明,3DZip在三个基准上仅用128个令牌即可保留94.7%的性能,并实现1.92倍的推理加速。
正文节选
3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering Abstract Recent 3D vision-language models (3D VLMs) construct geometry aware tokens by projecting 2D visual features into world coordinates, enabling spatial reasoning for tasks such as 3D question answering. However, this design generates thousands of tokens per scene, resulting in substantial computational and memory overhead. While token compression has been extensively studied in 2D VLMs, existing appro