返回主题地图

具身智能

技术方向 · AI 走进物理世界:人形机器人、具身基础模型与真实环境操作 · 共 270 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月7日周五 · 1 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

IJCAI 2026综述:人类视频如何桥接机器人动作学习

清华大学、香港科技大学、微软亚洲研究院等机构在IJCAI 2026发表综述论文,提出人类视频与机器人动作之间的‘表示桥’框架,将现有方法分为潜在动作、显式2D、显式3D和世界模型四条路线。论文指出这些路线本质是选择不同的监督信号层级,可叠加使用,并分析了各自局限与开放挑战。作者冯志远认为世界模型研究逻辑更完整,但工业界目前VLA+RL效果更好,具身智能的GP

8月6日周四 · 4 条
正文结构化主题已通过公开置信门槛
NVIDIA Generative AI Blog一手来源模型发布

NVIDIA 发布 Cosmos 3 开放世界模型,推动物理 AI 发展

NVIDIA 发布了 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础模型系列,包含 Super、Nano 和 Edge 三个版本,支持视觉推理、世界生成和动作预测。该模型在多个基准测试中排名第一,并采用 Linux 基金会的 OpenMDW 1.1 许可证,允许开发者进行后训练和定制。NVIDIA 还通过 Omnivers

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

李飞飞等联手提出MVA:机器人直接借用视频模型,15小时实现跨本体泛化

斯坦福李飞飞、吴佳俊、张吕民及哈佛Yilun Du等学者联合发表论文MVA,提出将机器人动作转化为像素遮罩轨迹,直接利用现成视频生成模型Wan2.2,仅用15小时数据微调即可实现跨本体泛化。该方法通过URDF和逆运动学解算,解决了机器人跨机型迁移难题,挑战了机器人需专属大模型的主流认知,对具身智能产业影响深远。

正文结构化主题已通过公开置信门槛
Google Gen AI JavaScript SDK Releases一手来源产品发布

Google Gen AI JS SDK v2.16.0 发布,支持 Gemini Robotics ER 2 预览模型

Google 发布了 Gen AI JavaScript SDK 的 v2.16.0 版本,新增了 Gemini Robotics ER 2 Preview 模型支持,并在 FinishReason 枚举中增加了 TOO MANY TOOL CALLS 值。此外,该版本为 Interaction 资源添加了顶层 errors 数组,并将 HttpOption

正文结构化主题已通过公开置信门槛
8月5日周三 · 1 条
正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源研究

NVIDIA 提出世界动作模型,Cosmos 3 助力机器人操作泛化

NVIDIA 技术博客探讨了从视觉-语言-动作模型(VLA)向世界动作模型(WAM)的转变,指出 WAM 基于视频世界模型构建,能更好地泛化物理交互。NVIDIA 发布了 Cosmos 3 世界基础模型,并基于其训练了 DROID 机器人策略,实验显示 omni 检查点将成功率从 28.1% 提升至 36.8%。

8月4日周二 · 9 条
正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

SG-WAM:几何感知策略空间中的自引导世界建模

SG-WAM 是一种自引导世界建模框架,在几何感知的策略空间中学习动作条件动力学。该框架通过可学习的动力学令牌和自引导世界预测器,在策略表示空间中预测未来状态,并结合几何监督和流匹配动作生成进行端到端优化。基于 0.9B 参数的模型,SG-WAM 在 LIBERO 基准上达到 98.5% 的平均成功率,在 LIBERO-Plus 上达到 73%,无需大规模具

正文结构化主题已通过公开置信门槛
TechCrunch AI研究

马斯克在特斯拉财报会上过半时间谈AI和机器人

TechCrunch与Hudson Labs合作,分析了特斯拉2019年以来财报电话会议记录,发现马斯克在电话会上谈论AI、机器人出租车和全自动驾驶的时间占比已从2022年的15%-20%升至近50%,而谈论汽车业务的时间降至不足三分之一。其他高管如CFO Taneja和工程副总裁Moravy虽仍更关注汽车业务,但AI相关话题占比也在上升。分析显示马斯克正将

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

NVIDIA发布Alpamayo 1.5:面向自动驾驶的100亿参数推理VLA模型

NVIDIA发布了Alpamayo 1.5,这是一个基于Cosmos-Reason2 VLM骨干的100亿参数链式思维推理VLA模型,专为自动驾驶社区设计。该模型支持导航引导、灵活摄像头数量和用户问答,采用扩散轨迹解码器,并已通过RL后训练。模型权重在OpenMDW-1.1许可下发布,源代码采用Apache 2.0,主要用于处理自动驾驶中的罕见长尾事件。

正文结构化主题已通过公开置信门槛
Google AI一手来源产品发布

谷歌2026年7月AI新闻:新Gemini模型、机器人技术与创意工具

谷歌在2026年7月发布了一系列AI更新,包括推出三款新的Gemini模型(3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber)以提升代理工作流的效率,以及发布Gemini Robotics ER 2模型以增强机器人的具身推理能力。此外,谷歌还扩展了创意工具,如Lyria 3.5音乐生成模型和Google Vids的视频生成功能

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

泳池机器人技术竞争开启:浪涌未来押注AI与无人化

泳池机器人行业在无线化红利消退后,面临技术范式转移的挑战。浪涌未来CTO刘华指出,当前竞争聚焦于存量市场,而水下感知、全池清洁和无人化等核心问题尚未解决。浪涌未来通过多传感器融合(激光雷达、超声波、视觉)和算法优化,在X10和A10产品上实现了高覆盖率清洁,并计划通过AI和无人化闭环推动行业进入下一轮竞争。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

DreamTraj:通过读取未渲染的视频扩散潜变量生成 6-DoF 物体轨迹

DreamTraj 提出一种新方法,从单张 RGB 图像和语言指令直接预测物体的 6-DoF 轨迹,通过读取冻结的图像到视频扩散模型在早期去噪步骤中的内部表示,而非生成视频后再提取运动。该方法还引入了 MOVE 数据集,包含 5,038 个带细粒度语言注释的以物体为中心的自我中心轨迹。DreamTraj 在平移和旋转预测上均达到最先进水平,且比生成后提取的流

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

奇瑞长安东风入局,无人配送车是真风口还是新泡沫?

2025-2026年,中国无人配送车行业因成本下降、路权明确和客户结构变化而快速增长,预计2030年年销量达86万台。奇瑞、长安、东风等主机厂和Tier 1供应商纷纷入局,与L4公司合作或自研,推动行业从试点走向规模化。但行业仍面临标准不统一、安全等挑战,竞争焦点转向成本、稳定性和运营能力。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

WCM:用于视觉-语言-动作强化学习的世界评论家模型

WCM是一种用于视觉-语言-动作(VLA)模型强化学习的世界评论家模型,通过轻量级LeJEPA架构联合预测未来潜在状态和估计价值,解决部分可观测性下的价值估计问题。实验在149个任务和四个基准上取得最先进性能,并在七个真实世界操作任务中验证了部署稳定性。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

物理 AI 模拟现状综述:仿真引擎与三计算机范式

Hugging Face 博客发布了一篇关于物理 AI 模拟现状的综述,指出数据稀缺是物理 AI 发展的主要挑战,而仿真通过 GPU 并行可低成本生成大量训练数据。文章介绍了训练、仿真和机载三计算机范式,并概述了 MuJoCo、MuJoCo Warp、NVIDIA Isaac Sim 和 Isaac Lab 等主流仿真引擎的特点与适用场景。该综述旨在帮助开发

8月3日周一 · 2 条
正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

N 0-VTLA:带潜在触觉令牌的视觉-触觉-语言-动作模型

N 0-VTLA 是一个视觉-触觉-语言-动作(VTLA)基础模型,通过触觉感知和反馈控制实现精细的接触丰富操作,并支持从部署数据中进行离线策略改进。该模型采用视觉-触觉预训练、分阶段触觉通路集成和优势条件离线强化学习(ALTER)的训练方案,在九个真实机器人任务中全部获胜,并在二十任务模拟套件中达到63.8%的平均成功率,显著优于最强基线。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源模型发布

FLUX 3 发布:统一多模态流模型,支持图像视频音频与动作预测

Black Forest Labs 发布了 FLUX 3,这是一个统一的多模态流匹配基础模型,支持图像、视频、音频和动作预测。其核心创新是 Self-Flow 框架,通过自监督特征重建目标同时提升生成质量和表征质量,在机器人操作任务中成功率从 42% 提升至 71%。FLUX 3 支持长达 20 秒的同步音频视频生成,并计划后续开放 Dev 权重。

8月2日周日 · 1 条
正文结构化主题已通过公开置信门槛
AI at Meta Blog一手来源研究

Meta AI模型助力RAMMP项目,开发智能辅助机器人平台

美国匹兹堡大学的人类工程研究实验室(HERL)与ATDev合作,在ARPA-H提供的最高4150万美元资助下,开发名为RAMMP的机器人辅助移动与操作平台,旨在帮助轮椅使用者。该项目整合了Meta的开源AI视觉模型DINO和SAM,并采用边缘计算和数字孪生技术,以提升设备在真实环境中的响应能力。该技术已集成到首个原型中,支持通过自然语言和图像查询环境,减少用

7月30日周四 · 2 条
正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源模型发布

谷歌发布 Gemini Robotics ER 2 具身推理模型,支持多机器人协作

Google DeepMind 发布 Gemini Robotics ER 2,这是其最强大的具身推理模型,旨在作为机器人的高级大脑,支持视频理解、任务编排和多机器人协作。该模型通过 Gemini API 和 Google AI Studio 向开发者公开,并已在 Gemini Enterprise Agent Platform 提供私有预览。Gemini

正文结构化主题已通过公开置信门槛
Gemini API Release Notes一手来源模型发布

Gemini 发布机器人 ER 2 预览模型,旧版将于 8 月关闭

Gemini API 于 2026 年 7 月 30 日发布了两款新的具身推理模型端点:gemini-robotics-er-2-preview 和 gemini-robotics-er-2-streaming-preview,分别支持高级空间推理、智能体代码执行、多步工具编排、视频时刻查找、进度分类、多机器人协调,以及通过 Live API 实现低延迟实时