返回全部动态

星尘智能发布SmoothRL框架,实现异步在线强化学习

原标题:机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理

量子位研究质量 80

AI 摘要

星尘智能发布异步在线强化学习框架SmoothRL,解决大模型异步推理下机器人动作与计划不一致的问题。该框架仅对实际执行的动作进行强化学习,并在真实高动态投掷任务中验证,成功率显著提升。SmoothRL强调在部署中强化学习,使机器人能持续从真实执行结果中修正策略。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理 星尘智能(Astribot) 基座模型团队发布能异步执行的在线强化学习框架 SmoothRL 真实机器人没有“暂停键”。 现在的 VLA、World-Action Model 往往一次生成未来一段时间的动作序列,也就是 action chunk。模型越来越大,推理时间也越来越长,但机器人不能每隔几百毫秒就停下来等模型推理下一段时间的动作。尤其在投掷这类高动态任务里,一次停顿就可能让已经积累起来的速度掉下去,导致整个任务失败。 所以真实部署里更常见的方式是异步推理:机器人继续执行手头的动作,模型同时在后台计算下一段。简单说,手上做 A,模型已经在算 B。 但这给在线强化学习带来了一个新的问题:模型一次生成了一段动作序列(action chunk),进入物理世界的真正会用的,却往往只有其中一部分。模型“计划过”的动作,和机器人“真正做过”的动作,不再完全相同。 近日,星尘智能(Astribot) 基座模型团队发布能异步执行的在线强化学习框架 SmoothRL(Online Reinforcement L


发布时间:2026-09-04 17:19
抓取时间:2026-09-04 18:24
来源机构:量子位
阅读原文qbitai.com