返回全部动态

2B模型凭动态注意力超越大模型,S²-VLA解决长程操控误差

原标题:机械臂做到第10步就容易出错?一个 2B 模型靠动态调整注意力解决了 | IJCAI 2026

雷峰网 AI科技评论研究质量 67

AI 摘要

华东师范大学与上海交通大学团队提出S²-VLA模型,通过信念状态和自适应动态门控机制,使2B参数模型在长程机械臂任务中达到96.4%成功率,超越多数7B甚至8.5B模型。该模型动态调整视觉、意图和动作注意力权重,有效缓解累积误差,推理显存约7GB,吞吐量80.8Hz,适合端侧部署。研究强调阶段自适应调度比单纯扩大参数更具价值。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

0 作者丨张 璐 编辑丨幸丽娟 过去一段时间,Scaling Law 在具身智能里被看得很重。为了让机械臂完成复杂的搬运、对准和组合,多数工作把视觉-语言-动作(VLA)模型做到 7B 甚至 8.5B。参数变大后,语义理解和场景识别确实更强了,但长程操控里的不稳定问题并没有随之消失。 很多大参数量 VLA 在执行到第 10 步或更后面时会出现突然失败。核心原因是累积误差放大(Cumulative Error Propagation):早期哪怕只有毫米级定位偏差,也会在后续步骤中逐步放大,最终导致抓取失败或动作中断。参数量大了,语义理解确实更强,但模型在动作后半程还是很难及时纠正偏差。 华东师范大学与上海交通大学团队提出的 S²-VLA 针对这个问题做了改进。工作由谢志鹏、韩宗益(共同一作)、赵静(通讯作者)和孙仕亮等完成。 他们没有继续堆参数,而是加了信念状态和自适应动态门控,让模型能按当前阶段调整注意力。结果是:2B 参数量的模型在 LIBERO-Long 上达到 96.4% 成功率,超过了多数 7B 甚至 8.5B 的模型。 论文链接:https://arxiv.org/pdf/2


发布时间:2026-09-03 18:10
抓取时间:2026-09-03 20:19
来源机构:雷峰网
阅读原文leiphone.com