张磊:不以动作为输入条件,就不叫世界模型
原标题:对话 IDEA 张磊:「不以动作为输入条件,就不叫世界模型」
AI 摘要
IDEA研究院讲席科学家、视启未来创始人张磊在接受雷峰网专访时,明确提出了世界模型的严格定义:必须以动作输入为条件,即Action Conditioned的Next State Prediction。他认为纯视频生成模型如Sora因未建模动作不能称为世界模型,并指出隐空间路线优于像素路线,同时强调在隐空间中引入物体结构是提升物理合理性的关键。张磊还分析了具身智能面临的挑战,认为大脑比本体更难更重要,世界模型为机器人提供了虚拟训练场,是解决真实试错成本高的关键。
正文节选
0 作者丨幸丽娟 编辑丨林觉民 2026年上半年,中国AI圈的钱和人都涌向同一方向:世界模型。 仅前六个月,国内世界模型赛道披露融资总额约300亿元,如果把“具身智能+世界模型”融合赛道算进来,这个数字膨胀到900多亿。 相比去年同期,融资增速超 5 倍。 百亿资金,海量人才,如潮水般涌入。 一个绕不过去的问题是:这么多人冲进来,究竟有多少人真的想清楚了这个东西到底是什么? 从业者在找方向,投资人在找人,猎头在摸组织,大厂战略部门在研究谁能活下来。 一件奇怪的事是,所有人都在问同样的问题:有没有谁能把世界模型这件事讲清楚? 有。 我们今天深访IDEA研究院讲席科学家、视启未来创始人张磊,一起来聊清这件事。 他是IEEE Fellow,Google Scholar引用超77000次。他的DINO系列在COCO霸榜5个月,Grounding DINO 和后续的 DINO-X 力压谷歌和Meta,被李飞飞团队、英伟达、银河通用等多个全球顶尖机构“标配”引用。 2025年他带着团队从IDEA孵化创立视启未来,天使轮一个月就到账近亿元。 身后还站着两位 AI 巨擘:学术导师张钹院士(中国人工智能