返回全部动态

吴佳俊 ECCV 2026 演讲:用物理统一视觉听觉触觉多模态融合

原标题:不堆 Transformer,斯坦福吴佳俊如何用物理重新定义多模态融合?|ECCV 2026

雷峰网 AI科技评论研究质量 75

AI 摘要

斯坦福大学助理教授吴佳俊在 ECCV 2026 发表演讲,提出不依赖堆叠 Transformer 的多模态融合新范式:将视觉、听觉、触觉视为同一组物理属性(几何、材质、刚度)在不同感官通道上的投影,用统一物理底座建立跨模态共同坐标系。他介绍了 PhysDreamer(从视频扩散模型蒸馏物理属性)、WonderPlay(将仿真器输出作为生成模型条件)以及声音可微分渲染(DiffImpact、RealImpact)和柔性电子皮肤(DexSkin)等工作,旨在解决新领域数据稀缺时多模态融合缺乏原则的问题。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

视觉、听觉、触觉三种数据,其实是同一组物理属性在不同感官通道上的投影。     作者丨陈淑瑜     编辑丨岑   峰                                                                                                         2026年9月8日,欧洲计算机视觉会议 ECCV 在瑞典马尔默召开。在 9 月 9 日的“ Embodied Multimodal Reasoning in Physical Environments(物理环境中的具身多模态推理)”专题分场上,斯坦福大学计算机科学助理教授吴佳俊发表了一场横跨视觉、声音与触觉的演讲。这已经是吴佳俊两个月内的第三场重要演讲,而每一场的切入口都不同。9月8日,他在 ECCV 期间的“Robotic Manipulation Research”Workshop 上转向了操作与规划:让基础模型自动发现“原子技能”及其前置与后置条件,构成可组合的抽象,使机器人能从极少演示泛化到长程任务,并配套一系列评测基准。而9月9日这场,他换了一个方向。前


发布时间:2026-09-11 17:39
抓取时间:2026-09-11 20:16
来源机构:雷峰网
阅读原文leiphone.com