吴佳俊 ECCV 2026 演讲:用物理统一视觉听觉触觉多模态融合
原标题:不堆 Transformer,斯坦福吴佳俊如何用物理重新定义多模态融合?|ECCV 2026
AI 摘要
斯坦福大学助理教授吴佳俊在 ECCV 2026 发表演讲,提出不依赖堆叠 Transformer 的多模态融合新范式:将视觉、听觉、触觉视为同一组物理属性(几何、材质、刚度)在不同感官通道上的投影,用统一物理底座建立跨模态共同坐标系。他介绍了 PhysDreamer(从视频扩散模型蒸馏物理属性)、WonderPlay(将仿真器输出作为生成模型条件)以及声音可微分渲染(DiffImpact、RealImpact)和柔性电子皮肤(DexSkin)等工作,旨在解决新领域数据稀缺时多模态融合缺乏原则的问题。
正文节选
视觉、听觉、触觉三种数据,其实是同一组物理属性在不同感官通道上的投影。 作者丨陈淑瑜 编辑丨岑 峰 2026年9月8日,欧洲计算机视觉会议 ECCV 在瑞典马尔默召开。在 9 月 9 日的“ Embodied Multimodal Reasoning in Physical Environments(物理环境中的具身多模态推理)”专题分场上,斯坦福大学计算机科学助理教授吴佳俊发表了一场横跨视觉、声音与触觉的演讲。这已经是吴佳俊两个月内的第三场重要演讲,而每一场的切入口都不同。9月8日,他在 ECCV 期间的“Robotic Manipulation Research”Workshop 上转向了操作与规划:让基础模型自动发现“原子技能”及其前置与后置条件,构成可组合的抽象,使机器人能从极少演示泛化到长程任务,并配套一系列评测基准。而9月9日这场,他换了一个方向。前