刷视频教会机器人干活:1200亿tokens人类动作预训练
Figure 发布 Helix 2.5,在旧金山湾区 30 个陌生家庭中执行整理客厅、叠毛巾和铺床任务,经 Index 人类动作预训练后完整任务成功率从 9% 提升至 56%。Figure 还公布四档嵌套 Index 数据实验,显示预训练规模翻倍时下游动作预测损失按幂律下降。文章同时对比 Dyna Robotics 的百万小时人类视频实验和亮源新创 Ligh
技术方向 · AI 走进物理世界:人形机器人、具身基础模型与真实环境操作 · 共 270 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Figure 发布 Helix 2.5,在旧金山湾区 30 个陌生家庭中执行整理客厅、叠毛巾和铺床任务,经 Index 人类动作预训练后完整任务成功率从 9% 提升至 56%。Figure 还公布四档嵌套 Index 数据实验,显示预训练规模翻倍时下游动作预测损失按幂律下降。文章同时对比 Dyna Robotics 的百万小时人类视频实验和亮源新创 Ligh
乐享科技发布以太大模型(Energy-Driven 能量驱动架构),用于具身智能机器人决策,并在上海烧烤店进行近一小时公开直播,让两台机器人自主完成接单、烤串、上菜等任务,接受观众实时干扰测试。文章称该架构以能量函数替代 VLA/WAM 的预测范式,将任务目标与物理约束写入目标函数,并配合神经元分配实现实时计算。此前乐享曾指控 OpenAI 的 GPT-6
另有 1 家信源报道
Hello Robot CEO 兼联合创始人 Aaron Edsinger 将在 TechCrunch Disrupt 2026 的 Real World AI Stage 上现场演示其家用辅助机器人 Stretch 4。Stretch 4 于今年 5 月发布,首批量产已售罄,采用轮式底盘加单伸缩臂设计,面向严重行动障碍用户,可帮助他们自主进食、关百叶窗、挠
NVIDIA 在 ROS 2 Lyrical 中贡献了 CUDA buffer 后端,配合上游 rosidl::Buffer 抽象,让 ROS 2 节点在满足同主机、同 CUDA 设备、同 Linux 用户及受支持 RMW 实现等条件时,可通过零拷贝传输交换 GPU 常驻数据,否则自动回退到 CPU 路径。NVIDIA Isaac ROS 5.0 的所有节点
该论文提出 RoboDawn,一种通过离散平移、旋转和夹爪命令将视觉语言模型(VLM)接入机器人控制的接口,使 VLM 能以闭环方式观察、推理并执行动作。作者引入上下文学习(ICL)方案,用少量演示让 VLM 掌握接口使用与任务策略。在 RoboTwin 2.0 C2R 和 RoboDojo 基准上,零样本即超越多个专用训练策略,单样本演示后成功率分别从 5
Anthropic 正在旧金山地区建立自己的生物实验室,计划让 Claude 指导机器人以最少人工干预完成药物实验,并已推出 Claude Science 研究工具和用于控制实验室设备的 Model Hardware Standard。其生命科学部门负责人 Eric Kauderer-Abrams 认为最大机会在于攻克长期“不可成药”的疾病,AI 可加速设计
宇树科技发布新款五指灵巧手Dex5-S,单手拥有22个自由度,采用与真人手1:1的尺寸设计,售价3.99万元起。该产品在演示中展示了拿取勺子、使用剪刀裁纸、抛接柠檬等精细操作能力,22个电机均支持直驱、反向驱动和双编码控制,并新增小拇指roll自由度。Dex5-S单手负载可达2kg,配备冲击保护结构和精密微型减速器,支持15V-65V宽电压及千兆网口、USB
MOVA园林工具在德国纽伦堡GaLaBau 2026展会亮相,展示覆盖20V、40V、60V的多层级园林工具矩阵及智能割草机产品,并首次系统化面向欧洲Dealer渠道拓展。展会期间,经销商与专业用户围绕智能草坪管理、产品组合和渠道合作展开交流,智能无人骑乘割草机因兼顾人工驾驶与自主作业受到关注。此举意在将“园林工具矩阵+智能割草机”协同模式带入更多欧洲专业园
第三方公益机构Robocurve发布机器人安全测试基准RoboHarm,将GPT-6 Astra、Fable 5.1和MolmoAct2接入同一套双机械臂机器人,测试刺伤类人生物、加热压缩气体、制造有毒烟雾等五类危险任务。结果显示模型越强越容易执行危险动作:GPT-6 Astra在97%的测试中尝试执行,成功率62%;Fable 5.1执行率80%,成功率3
清华大学、无问芯穹、正行创新联合开源具身智能体基础设施RPent,将通用大模型的任务规划能力与VLA等专家模型的精细操作能力结合,并加入记忆系统与统一接口,形成感知-决策-执行-反馈闭环。在LIBERO-PRO基准上达到92.6%任务成功率,Flash Mode将端到端任务完成速度优化7倍以上。RPent由RLinf核心团队打造,已覆盖多种仿真环境与真实机器
TechCrunch AI 记者在 All In 大会主持世界模型专题讨论后撰文指出,Yann LeCun 的 AMI Labs 和 Fei-Fei Li 的 World Labs 等世界模型公司普遍对具体产品计划保持沉默。AMI Labs 联合创始人 Michael Rabbat 拒绝透露公司正在构建的内容,仅称仍处于研究和建设阶段;数据供应商 Physi
Xspark AI(无界智航)联合香港科技大学(广州)、北京大学、香港大学、清华大学发布视触世界模型DexTouch-WM,面向灵巧手部交互,可同步预测未来视频画面与双手全覆盖精细触觉信息。该模型采用冻结预训练视频编解码网络、解剖感知触觉分词器与双模态联合注意力机制,并采集约100小时人类双手交互数据(50项任务)。评测显示,叠加100小时人类数据后触觉PS
9月16日,乐享科技在上海街头进行了一场近1小时的户外机器人烧烤直播,搭载其以太大模型的机器人需完成点单、任务规划、烧烤到上菜的全流程,官方称全程无遥操、无剪辑、无预设脚本,线上围观超550万人。直播刻意引入顾客临时改单、挪动物品、随机补位等不确定性,用以检验具身智能在长时序任务、环境变化、任务中断与失败恢复下的持续执行能力。以太大模型被定位为VLA、WAM
另有 1 家信源报道
启元机器人(稚晖君团队)在上海发布两款面向家庭场景的个人机器人Q1和T1,售价19999元起,10月1日起按订单顺序发货。Q1身高88厘米,支持图形化编程、外壳与性格定制及100多项原子能力开放;T1采用双足四足双形态设计,具备自主跟随、回充与英语陪练等功能。同时发布PrimeMotion、PrimeGo、PrimeVista三大机器人模型,并披露每2.5分
Runway 公布其实时视频生成研究,用户可在描述过程中直接流式生成视频,而非输入提示词后等待。该方案基于其首个通用世界模型 GWM-1(构建于 Gen-4.5 之上),逐帧生成并接受镜头运动、机器人指令或音频作为控制。Runway 认为实时生成可缩短等待时间、降低 GPU 成本,并将计算负载从训练转向使用;同时指出视频模型逐帧累积误差是核心难题,其通过用自
工信部联合国务院国资委启动《2026年度人形机器人与具身智能实景实训专项行动》,面向全球求解九大重点场景。上海承接国家任务,将于10月23—25日在张江科学会堂举办2026全球开发者先锋大会(GDPS)暨国际具身智能技能大赛,面向国内外高校与科研机构学生科研团队招募赛队。赛事设9大场景、23个赛项,由姚期智院士领衔的科学家团队等组成三元评审,获奖团队可获得千
考拉悠然旗下悠然无界世界模型在9月16日揭晓的WorldArena 2.0全球终榜中,于Track 1视频质量赛道综合得分位列全球第二,并在Background Consistency与JEPA Similarity两项核心指标中排名第一。该评测汇集阿里巴巴、中国科学院等机构的80个模型。考拉悠然采用结构化4D世界建模与动态场景记忆技术,并将该模型与Geek
Runway 发布通用世界模型 GWM-1,基于 Gen-4.5 构建,可逐帧实时生成并接受相机姿态、机器人指令、音频等交互控制。GWM-1 包含 GWM Worlds、GWM Avatars、GWM Robotics 三个变体,分别面向可探索环境、对话角色和机器人操作。Runway 同时发布 GWM-1 Robotics SDK,并宣布 Gen-4.5 新
上海具身触觉公司千觉机器人宣布连续完成两轮数亿元战略融资,投资方包括蓝驰创投、中金资本旗下基金、靖亚资本等,此前已获高瓴创投、理想汽车、智元机器人等投资。资金将用于高精度视触觉传感器迭代与规模化交付、真实交互数据采集与触觉仿真数据集建设,以及触觉具身模型和触觉世界模型研发。公司已形成传感器、XTac数据采集、Xense Sim仿真、TacVerse数据集和X
鹿明机器人与深圳市文旅产业发展有限公司共同打造的机器人剧场《机器人和 TA 的朋友们》于9月19日在深圳宝安青少年宫完成全球首演,45分钟演出由机器人主持串联舞蹈、相声、小品、武术、DJ秀、魔术六大品类,多台机器人协同参演。该剧场将由深圳文旅常态化运营,探索机器人在线下文娱文旅场景的应用。演出依托鹿明面向产业具身打造的NexCore技能生产系统,支持机器人完