返回全部动态
打破黑盒:SpatialSV 用 3D 几何监督提升大模型空间智能
原标题:打破黑盒猜想:大模型通往真正「空间智能」的破局之路
AI 摘要
中山大学团队提出 SpatialSV 方法,通过在多模态大模型隐藏层引入显式 3D 几何监督(深度图、射线图、点云图),提升空间智能,并利用开源 3D 模型自动生成监督信号,减少 50% 人工文本标注。实验表明该方法能可视化模型内部表征,诊断空间推理缺陷,并在半监督条件下接近全量标注性能,为具身智能训练提供低成本路径。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
0 作者丨张 璐 编辑丨幸丽娟 先来看一道简单的多模态大模型视觉考题: 观察给出的几张室内多视角照片,请回答:从图 1 的视角来看,蓝色椅面的办公椅右边是什么? A. 单人沙发以及旁边的一张小桌子 B. 摆着微波炉的桌子 C. 小厨房 D. 蓝色垃圾桶 Qwen2.5-VL-7B精准选择了正确答案 A;LLaVA-OneVision-8B却选了 D。 按照以往的习惯,我们大概率会把原因归咎于模型在做多视角坐标转换时逻辑迷航了,或者它的空间推理能力不够,把左右相对位置搞混了。 但中山大学团队却在论文《SpatialSV: Internalizing Interpretable 3D Spatial Awareness in MLLMs via Task-Oriented Visual Supervision》中,给出了一个意想不到的答案。 研究团队像给模型做脑部 CT 诊断一样,提取出 LLaVA 在推理生成时的中间隐藏层特征,渲染成了一张 3D 空间点云图。 瞬间真相大白:在 LLaVA 脑海里建构的三维几何画卷中,那张作为关键参照物的“小桌子”,压根就没有被建模出来。 这项工作的核心
发布时间:2026-09-03 18:07
抓取时间:2026-09-03 20:19
来源机构:雷峰网