返回主题地图

具身智能

技术方向 · AI 走进物理世界:人形机器人、具身基础模型与真实环境操作 · 共 29

8月11日星期二 · 3
雷峰网 AI科技评论商业20

蚂蚁领投戴盟数亿元融资,触觉物理AI加速商业化

戴盟机器人宣布完成数亿元融资,由蚂蚁集团领投,老股东超额跟投,两个月内连续完成两轮融资。该公司孵化于香港科技大学,专注于触觉感知与物理AI,发布了全球首个触觉锚定世界模型Daimon-TWM,并已实现视触觉传感器万片级出货,服务全球200余家客户。融资将用于推动触觉感知、数据与模型的商业化落地,覆盖3C精密制造和汽车智造等场景。

另有 1 家信源报道

量子位商业7

机器人维修新职业兴起:月入6000元,技术门槛低但配件垄断

随着机器人出货量爆发式增长,市场出现了机器人维修新岗位,从业者月收入约6000至8000元。维修技术门槛不高,但配件被厂家垄断,第三方维修比返厂便宜且省时。目前维修订单量少,商家多靠培训等副业盈利,行业处于早期阶段。

Hugging Face Daily Papers一手来源研究11

RynnValue:利用时间距离扩展机器人价值基础模型

阿里巴巴达摩院开源了机器人操作价值基础模型RynnValue,利用时间距离作为监督信号,在超过7000小时、约300万条指令条件片段的数据上训练,无需偏好或进度标注。该模型在RBM-EVAL-OOD基准上平均Kendall's tau_a达到0.675,超过完全偏好监督的现有最优方法(0.655),并显著优于仅使用进度的方法(0.292)。通过基于势能的奖励

8月10日星期一 · 2
量子位商业3

灵巧手半年融资超200亿,技术路线与成本争议并存

量子位报道称,2025年上半年灵巧手相关企业融资超200亿元,成为具身智能赛道最热风口。全球约50%的灵巧手企业在中国,多数押注五指路线,但技术成熟度、量产和商业落地仍存巨大鸿沟。文章分析了灵巧手的技术路线、成本构成(电机和传感器占大头)及行业争议,指出当前产品耐用性不足,且五指灵巧手在工业场景中可能并非最优解。

量子位模型发布4

Om AI联汇开源端侧原生VLX-Seek 1.5,3B模型多项评测超越英伟达

Om AI联汇完成数亿元融资,并开源全球首款端侧原生模型VLX-Seek 1.5。该模型有3B和10B两个版本,采用流式多模态架构,在无人机视角、指代表达理解等任务上超越英伟达LocateAnything等更大模型。公司旨在通过端侧原生路线,推动物理AI在机器人、无人机等场景的规模化落地。

8月7日星期五 · 1
雷峰网 AI科技评论研究0

IJCAI 2026综述:人类视频如何桥接机器人动作学习

清华大学、香港科技大学、微软亚洲研究院等机构在IJCAI 2026发表综述论文,提出人类视频与机器人动作之间的‘表示桥’框架,将现有方法分为潜在动作、显式2D、显式3D和世界模型四条路线。论文指出这些路线本质是选择不同的监督信号层级,可叠加使用,并分析了各自局限与开放挑战。作者冯志远认为世界模型研究逻辑更完整,但工业界目前VLA+RL效果更好,具身智能的GP

8月6日星期四 · 4
NVIDIA Generative AI Blog一手来源模型发布0

NVIDIA 发布 Cosmos 3 开放世界模型,推动物理 AI 发展

NVIDIA 发布了 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础模型系列,包含 Super、Nano 和 Edge 三个版本,支持视觉推理、世界生成和动作预测。该模型在多个基准测试中排名第一,并采用 Linux 基金会的 OpenMDW 1.1 许可证,允许开发者进行后训练和定制。NVIDIA 还通过 Omnivers

雷峰网 AI科技评论研究0

李飞飞等联手提出MVA:机器人直接借用视频模型,15小时实现跨本体泛化

斯坦福李飞飞、吴佳俊、张吕民及哈佛Yilun Du等学者联合发表论文MVA,提出将机器人动作转化为像素遮罩轨迹,直接利用现成视频生成模型Wan2.2,仅用15小时数据微调即可实现跨本体泛化。该方法通过URDF和逆运动学解算,解决了机器人跨机型迁移难题,挑战了机器人需专属大模型的主流认知,对具身智能产业影响深远。

Google Gen AI JavaScript SDK Releases一手来源产品发布0

Google Gen AI JS SDK v2.16.0 发布,支持 Gemini Robotics ER 2 预览模型

Google 发布了 Gen AI JavaScript SDK 的 v2.16.0 版本,新增了 Gemini Robotics ER 2 Preview 模型支持,并在 FinishReason 枚举中增加了 TOO_MANY_TOOL_CALLS 值。此外,该版本为 Interaction 资源添加了顶层 errors 数组,并将 HttpOption

8月5日星期三 · 1
NVIDIA Technical Blog一手来源研究0

NVIDIA 提出世界动作模型,Cosmos 3 助力机器人操作泛化

NVIDIA 技术博客探讨了从视觉-语言-动作模型(VLA)向世界动作模型(WAM)的转变,指出 WAM 基于视频世界模型构建,能更好地泛化物理交互。NVIDIA 发布了 Cosmos 3 世界基础模型,并基于其训练了 DROID 机器人策略,实验显示 omni 检查点将成功率从 28.1% 提升至 36.8%。

8月4日星期二 · 9
TechCrunch AI研究0

马斯克在特斯拉财报会上过半时间谈AI和机器人

TechCrunch与Hudson Labs合作,分析了特斯拉2019年以来财报电话会议记录,发现马斯克在电话会上谈论AI、机器人出租车和全自动驾驶的时间占比已从2022年的15%-20%升至近50%,而谈论汽车业务的时间降至不足三分之一。其他高管如CFO Taneja和工程副总裁Moravy虽仍更关注汽车业务,但AI相关话题占比也在上升。分析显示马斯克正将

Hugging Face New and Trending Models一手来源模型发布0

NVIDIA发布Alpamayo 1.5:面向自动驾驶的100亿参数推理VLA模型

NVIDIA发布了Alpamayo 1.5,这是一个基于Cosmos-Reason2 VLM骨干的100亿参数链式思维推理VLA模型,专为自动驾驶社区设计。该模型支持导航引导、灵活摄像头数量和用户问答,采用扩散轨迹解码器,并已通过RL后训练。模型权重在OpenMDW-1.1许可下发布,源代码采用Apache 2.0,主要用于处理自动驾驶中的罕见长尾事件。

Google AI一手来源产品发布0

谷歌2026年7月AI新闻:新Gemini模型、机器人技术与创意工具

谷歌在2026年7月发布了一系列AI更新,包括推出三款新的Gemini模型(3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber)以提升代理工作流的效率,以及发布Gemini Robotics ER 2模型以增强机器人的具身推理能力。此外,谷歌还扩展了创意工具,如Lyria 3.5音乐生成模型和Google Vids的视频生成功能

雷峰网 AI科技评论产品发布0

泳池机器人技术竞争开启:浪涌未来押注AI与无人化

泳池机器人行业在无线化红利消退后,面临技术范式转移的挑战。浪涌未来CTO刘华指出,当前竞争聚焦于存量市场,而水下感知、全池清洁和无人化等核心问题尚未解决。浪涌未来通过多传感器融合(激光雷达、超声波、视觉)和算法优化,在X10和A10产品上实现了高覆盖率清洁,并计划通过AI和无人化闭环推动行业进入下一轮竞争。

雷峰网 AI科技评论商业0

奇瑞长安东风入局,无人配送车是真风口还是新泡沫?

2025-2026年,中国无人配送车行业因成本下降、路权明确和客户结构变化而快速增长,预计2030年年销量达86万台。奇瑞、长安、东风等主机厂和Tier 1供应商纷纷入局,与L4公司合作或自研,推动行业从试点走向规模化。但行业仍面临标准不统一、安全等挑战,竞争焦点转向成本、稳定性和运营能力。

Hugging Face Daily Papers一手来源研究0

DreamTraj:通过读取未渲染的视频扩散潜变量生成 6-DoF 物体轨迹

DreamTraj 提出一种新方法,从单张 RGB 图像和语言指令直接预测物体的 6-DoF 轨迹,通过读取冻结的图像到视频扩散模型在早期去噪步骤中的内部表示,而非生成视频后再提取运动。该方法还引入了 MOVE 数据集,包含 5,038 个带细粒度语言注释的以物体为中心的自我中心轨迹。DreamTraj 在平移和旋转预测上均达到最先进水平,且比生成后提取的流

Hugging Face Blog一手来源研究0

物理 AI 模拟现状综述:仿真引擎与三计算机范式

Hugging Face 博客发布了一篇关于物理 AI 模拟现状的综述,指出数据稀缺是物理 AI 发展的主要挑战,而仿真通过 GPU 并行可低成本生成大量训练数据。文章介绍了训练、仿真和机载三计算机范式,并概述了 MuJoCo、MuJoCo Warp、NVIDIA Isaac Sim 和 Isaac Lab 等主流仿真引擎的特点与适用场景。该综述旨在帮助开发

Hugging Face Daily Papers一手来源研究0

SG-WAM:几何感知策略空间中的自引导世界建模

SG-WAM 是一种自引导世界建模框架,在几何感知的策略空间中学习动作条件动力学。该框架通过可学习的动力学令牌和自引导世界预测器,在策略表示空间中预测未来状态,并结合几何监督和流匹配动作生成进行端到端优化。基于 0.9B 参数的模型,SG-WAM 在 LIBERO 基准上达到 98.5% 的平均成功率,在 LIBERO-Plus 上达到 73%,无需大规模具

Hugging Face Daily Papers一手来源研究0

WCM:用于视觉-语言-动作强化学习的世界评论家模型

WCM是一种用于视觉-语言-动作(VLA)模型强化学习的世界评论家模型,通过轻量级LeJEPA架构联合预测未来潜在状态和估计价值,解决部分可观测性下的价值估计问题。实验在149个任务和四个基准上取得最先进性能,并在七个真实世界操作任务中验证了部署稳定性。

7月30日星期四 · 1
Gemini API Release Notes一手来源模型发布0

Gemini 发布机器人 ER 2 预览模型,旧版将于 8 月关闭

Gemini API 于 2026 年 7 月 30 日发布了两款新的具身推理模型端点:gemini-robotics-er-2-preview 和 gemini-robotics-er-2-streaming-preview,分别支持高级空间推理、智能体代码执行、多步工具编排、视频时刻查找、进度分类、多机器人协调,以及通过 Live API 实现低延迟实时

7月29日星期三 · 1
NVIDIA Technical Blog一手来源产品发布0

NVIDIA 发布 GPU 原生医学物理模拟框架,加速医疗机器人开发

NVIDIA 发布了面向医疗保健机器人的 GPU 原生医学物理模拟框架,旨在解决数据缺口、泛化能力和开发速度三大挑战。该框架包含内腔模拟模块,支持导管等柔性器械在血管内的实时模拟,并采用 XPBD 方法实现高效 GPU 计算。该模块已作为 Isaac for Healthcare 的一部分正式发布,可加速机器人策略训练和合成数据生成。

7月27日星期一 · 1
Import AI研究0

Import AI 466:机器人苦涩教训、AI 完成周级编程任务及 OpenAI 意外黑客

Import AI 466 报道了 Epoch 和 METR 发布的 MirrorCode 基准测试,用于评估 AI 系统完成长期编程任务的能力,结果显示 Opus 4.7 等模型能在 14 小时内完成人类需 2-17 周的任务,但仍有部分任务无法解决。同时,Anthropic 展示了 Claude Opus 4.7 在机器人任务中自主完成速度比人类快 20

7月22日星期三 · 1
NVIDIA Generative AI Blog一手来源开源0

NVIDIA 开源医疗物理模拟框架,加速医疗机器人开发

NVIDIA 宣布开源其医疗物理模拟框架,该框架集成于 Isaac for Healthcare,利用 GPU 加速模拟解剖与器械交互,支持机器人策略训练和测试。该框架结合经典物理模拟与生成式 AI,可并行运行数千个训练环境,显著缩短训练时间。多家医疗机器人公司如 CMR Surgical、Johnson & Johnson MedTech 等已开始采用该框

7月1日星期三 · 1
Berkeley AI Research Blog一手来源研究

BAIR 2026届博士毕业生展示

伯克利人工智能研究实验室(BAIR)公布了2026届博士毕业生名单,他们的研究涵盖机器人、大语言模型、计算机视觉、AI安全等领域。毕业生们将前往学术界、工业界或创业,其中多人加入OpenAI、Mistral AI等公司。

6月29日星期一 · 1
Import AI研究

NVIDIA 推出机器人自改进框架 ENPIRE,并反思 AI 预测的局限性

NVIDIA 研究人员开发了 ENPIRE 框架,使物理机器人能够像 AI 智能体一样自主实验和学习,在 PushT 等任务上达到 99% 成功率。该框架包含环境、策略改进、评估和进化模块,但扩展时面临基础设施挑战。此外,文章引用 Matthew Tokson 的论文,指出人类常低估或高估技术影响,提醒对 AI 未来保持谨慎。

8月2日星期日 · 1
AI at Meta Blog一手来源研究0

Meta AI模型助力RAMMP项目,开发智能辅助机器人平台

美国匹兹堡大学的人类工程研究实验室(HERL)与ATDev合作,在ARPA-H提供的最高4150万美元资助下,开发名为RAMMP的机器人辅助移动与操作平台,旨在帮助轮椅使用者。该项目整合了Meta的开源AI视觉模型DINO和SAM,并采用边缘计算和数字孪生技术,以提升设备在真实环境中的响应能力。该技术已集成到首个原型中,支持通过自然语言和图像查询环境,减少用

8月3日星期一 · 2
Hugging Face Blog一手来源模型发布0

FLUX 3 发布:统一多模态流模型,支持图像视频音频与动作预测

Black Forest Labs 发布了 FLUX 3,这是一个统一的多模态流匹配基础模型,支持图像、视频、音频和动作预测。其核心创新是 Self-Flow 框架,通过自监督特征重建目标同时提升生成质量和表征质量,在机器人操作任务中成功率从 42% 提升至 71%。FLUX 3 支持长达 20 秒的同步音频视频生成,并计划后续开放 Dev 权重。

Hugging Face Daily Papers一手来源研究0

N_0-VTLA:带潜在触觉令牌的视觉-触觉-语言-动作模型

N_0-VTLA 是一个视觉-触觉-语言-动作(VTLA)基础模型,通过触觉感知和反馈控制实现精细的接触丰富操作,并支持从部署数据中进行离线策略改进。该模型采用视觉-触觉预训练、分阶段触觉通路集成和优势条件离线强化学习(ALTER)的训练方案,在九个真实机器人任务中全部获胜,并在二十任务模拟套件中达到63.8%的平均成功率,显著优于最强基线。