RoboTracer:用3D空间感知与度量推理重塑机器人轨迹追踪
原标题:ECCV 2026 专访:让大模型「忘掉XYZ」,RoboTracer 用 3D 空间感知与度量推理重塑机器人轨迹追踪
AI 摘要
北航、北大、智源、中科院自动化所等团队提出 RoboTracer 框架,用图像坐标加度量深度 (u,v,d) 表示轨迹,使 VLM 能生成带物理尺度的 3D 轨迹,并配套构建了 450 万样本的 TraceSpatial 数据集。在 TraceSpatial-Bench 基准上,RoboTracer 成功率显著优于 Gemini-2.5-Pro,并在 UR5 和 Unitree G1 真机上验证了跨本体复用能力。
正文节选
用像素坐标加绝对深度表示轨迹,换本体不必重训模型。 作者丨张 璐 编辑丨幸丽娟 拿水壶从左到右依次给花浇水,喷头需悬停在每朵花上方 1 到 5 厘米处。 这个指令看似日常,对现在的具身系统却很苛刻:既要分清花的左右顺序,又要把喷头停在每朵花上方约 1–5 厘米。2D 轨迹一旦深度估错,喷头要么砸到花盆,要么对着空气做无用功。带绝对尺度和避障约束的指令,是当前系统的常见短板。一方面,端到端的视觉-语言-动作模型 (VLA) 可以直接输出动作,但真机示教成本高,换物体、换距离后容易失效。另一方面,通用视觉语言模型(VLM)的 2D 理解能力强,却缺少绝对尺度和深度感知,2D 轨迹抬到 3D 后容易悬空或碰撞。前者的问题在于视觉到动作的映射缺乏显式空间表征,场景稍有变化便需重新采集示教数据;后者则根本不知道“1厘米”在三维空间里意味着什么。在团队先前的探索中,模型已能