IJCAI 2026综述:人类视频如何桥接机器人动作学习
清华大学、香港科技大学、微软亚洲研究院等机构在IJCAI 2026发表综述论文,提出人类视频与机器人动作之间的‘表示桥’框架,将现有方法分为潜在动作、显式2D、显式3D和世界模型四条路线。论文指出这些路线本质是选择不同的监督信号层级,可叠加使用,并分析了各自局限与开放挑战。作者冯志远认为世界模型研究逻辑更完整,但工业界目前VLA+RL效果更好,具身智能的GP
技术方向 · AI 走进物理世界:人形机器人、具身基础模型与真实环境操作 · 共 270 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
清华大学、香港科技大学、微软亚洲研究院等机构在IJCAI 2026发表综述论文,提出人类视频与机器人动作之间的‘表示桥’框架,将现有方法分为潜在动作、显式2D、显式3D和世界模型四条路线。论文指出这些路线本质是选择不同的监督信号层级,可叠加使用,并分析了各自局限与开放挑战。作者冯志远认为世界模型研究逻辑更完整,但工业界目前VLA+RL效果更好,具身智能的GP
NVIDIA 发布了 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础模型系列,包含 Super、Nano 和 Edge 三个版本,支持视觉推理、世界生成和动作预测。该模型在多个基准测试中排名第一,并采用 Linux 基金会的 OpenMDW 1.1 许可证,允许开发者进行后训练和定制。NVIDIA 还通过 Omnivers
斯坦福李飞飞、吴佳俊、张吕民及哈佛Yilun Du等学者联合发表论文MVA,提出将机器人动作转化为像素遮罩轨迹,直接利用现成视频生成模型Wan2.2,仅用15小时数据微调即可实现跨本体泛化。该方法通过URDF和逆运动学解算,解决了机器人跨机型迁移难题,挑战了机器人需专属大模型的主流认知,对具身智能产业影响深远。
Google 发布了 Gen AI JavaScript SDK 的 v2.16.0 版本,新增了 Gemini Robotics ER 2 Preview 模型支持,并在 FinishReason 枚举中增加了 TOO MANY TOOL CALLS 值。此外,该版本为 Interaction 资源添加了顶层 errors 数组,并将 HttpOption
Google 发布了 Gen AI Python SDK 2.17.0 版本,新增了 Gemini Robotics ER 2 Preview 模型支持,并在 FinishReason 枚举中添加了 TOO MANY TOOL CALLS 值。该版本还修复了 Dotnet SDK 中 ResponseSchema 和 ResponseJsonSchema 的
NVIDIA 技术博客探讨了从视觉-语言-动作模型(VLA)向世界动作模型(WAM)的转变,指出 WAM 基于视频世界模型构建,能更好地泛化物理交互。NVIDIA 发布了 Cosmos 3 世界基础模型,并基于其训练了 DROID 机器人策略,实验显示 omni 检查点将成功率从 28.1% 提升至 36.8%。
SG-WAM 是一种自引导世界建模框架,在几何感知的策略空间中学习动作条件动力学。该框架通过可学习的动力学令牌和自引导世界预测器,在策略表示空间中预测未来状态,并结合几何监督和流匹配动作生成进行端到端优化。基于 0.9B 参数的模型,SG-WAM 在 LIBERO 基准上达到 98.5% 的平均成功率,在 LIBERO-Plus 上达到 73%,无需大规模具
TechCrunch与Hudson Labs合作,分析了特斯拉2019年以来财报电话会议记录,发现马斯克在电话会上谈论AI、机器人出租车和全自动驾驶的时间占比已从2022年的15%-20%升至近50%,而谈论汽车业务的时间降至不足三分之一。其他高管如CFO Taneja和工程副总裁Moravy虽仍更关注汽车业务,但AI相关话题占比也在上升。分析显示马斯克正将
NVIDIA发布了Alpamayo 1.5,这是一个基于Cosmos-Reason2 VLM骨干的100亿参数链式思维推理VLA模型,专为自动驾驶社区设计。该模型支持导航引导、灵活摄像头数量和用户问答,采用扩散轨迹解码器,并已通过RL后训练。模型权重在OpenMDW-1.1许可下发布,源代码采用Apache 2.0,主要用于处理自动驾驶中的罕见长尾事件。
谷歌在2026年7月发布了一系列AI更新,包括推出三款新的Gemini模型(3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber)以提升代理工作流的效率,以及发布Gemini Robotics ER 2模型以增强机器人的具身推理能力。此外,谷歌还扩展了创意工具,如Lyria 3.5音乐生成模型和Google Vids的视频生成功能
泳池机器人行业在无线化红利消退后,面临技术范式转移的挑战。浪涌未来CTO刘华指出,当前竞争聚焦于存量市场,而水下感知、全池清洁和无人化等核心问题尚未解决。浪涌未来通过多传感器融合(激光雷达、超声波、视觉)和算法优化,在X10和A10产品上实现了高覆盖率清洁,并计划通过AI和无人化闭环推动行业进入下一轮竞争。
DreamTraj 提出一种新方法,从单张 RGB 图像和语言指令直接预测物体的 6-DoF 轨迹,通过读取冻结的图像到视频扩散模型在早期去噪步骤中的内部表示,而非生成视频后再提取运动。该方法还引入了 MOVE 数据集,包含 5,038 个带细粒度语言注释的以物体为中心的自我中心轨迹。DreamTraj 在平移和旋转预测上均达到最先进水平,且比生成后提取的流
2025-2026年,中国无人配送车行业因成本下降、路权明确和客户结构变化而快速增长,预计2030年年销量达86万台。奇瑞、长安、东风等主机厂和Tier 1供应商纷纷入局,与L4公司合作或自研,推动行业从试点走向规模化。但行业仍面临标准不统一、安全等挑战,竞争焦点转向成本、稳定性和运营能力。
WCM是一种用于视觉-语言-动作(VLA)模型强化学习的世界评论家模型,通过轻量级LeJEPA架构联合预测未来潜在状态和估计价值,解决部分可观测性下的价值估计问题。实验在149个任务和四个基准上取得最先进性能,并在七个真实世界操作任务中验证了部署稳定性。
Hugging Face 博客发布了一篇关于物理 AI 模拟现状的综述,指出数据稀缺是物理 AI 发展的主要挑战,而仿真通过 GPU 并行可低成本生成大量训练数据。文章介绍了训练、仿真和机载三计算机范式,并概述了 MuJoCo、MuJoCo Warp、NVIDIA Isaac Sim 和 Isaac Lab 等主流仿真引擎的特点与适用场景。该综述旨在帮助开发
N 0-VTLA 是一个视觉-触觉-语言-动作(VTLA)基础模型,通过触觉感知和反馈控制实现精细的接触丰富操作,并支持从部署数据中进行离线策略改进。该模型采用视觉-触觉预训练、分阶段触觉通路集成和优势条件离线强化学习(ALTER)的训练方案,在九个真实机器人任务中全部获胜,并在二十任务模拟套件中达到63.8%的平均成功率,显著优于最强基线。
Black Forest Labs 发布了 FLUX 3,这是一个统一的多模态流匹配基础模型,支持图像、视频、音频和动作预测。其核心创新是 Self-Flow 框架,通过自监督特征重建目标同时提升生成质量和表征质量,在机器人操作任务中成功率从 42% 提升至 71%。FLUX 3 支持长达 20 秒的同步音频视频生成,并计划后续开放 Dev 权重。
美国匹兹堡大学的人类工程研究实验室(HERL)与ATDev合作,在ARPA-H提供的最高4150万美元资助下,开发名为RAMMP的机器人辅助移动与操作平台,旨在帮助轮椅使用者。该项目整合了Meta的开源AI视觉模型DINO和SAM,并采用边缘计算和数字孪生技术,以提升设备在真实环境中的响应能力。该技术已集成到首个原型中,支持通过自然语言和图像查询环境,减少用
Google DeepMind 发布 Gemini Robotics ER 2,这是其最强大的具身推理模型,旨在作为机器人的高级大脑,支持视频理解、任务编排和多机器人协作。该模型通过 Gemini API 和 Google AI Studio 向开发者公开,并已在 Gemini Enterprise Agent Platform 提供私有预览。Gemini
Gemini API 于 2026 年 7 月 30 日发布了两款新的具身推理模型端点:gemini-robotics-er-2-preview 和 gemini-robotics-er-2-streaming-preview,分别支持高级空间推理、智能体代码执行、多步工具编排、视频时刻查找、进度分类、多机器人协调,以及通过 Live API 实现低延迟实时