爱诗科技发布实时世界模型PixVerse R2,登X趋势榜第二
爱诗科技(AIsphere)发布实时世界模型PixVerse R2,9月22日上线当天登上X趋势榜第二。用户可在其生成的世界中通过WASD移动、用自然语言改变场景与剧情,实现从“看视频”到“进入世界”的交互。技术上,R2通过Omni Causal AR扩展世界建模能力,并用Real-Time Acceleration将能力带入实时运行区间,探索实时世界模型的
另有 1 家信源报道
技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 774 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
爱诗科技(AIsphere)发布实时世界模型PixVerse R2,9月22日上线当天登上X趋势榜第二。用户可在其生成的世界中通过WASD移动、用自然语言改变场景与剧情,实现从“看视频”到“进入世界”的交互。技术上,R2通过Omni Causal AR扩展世界建模能力,并用Real-Time Acceleration将能力带入实时运行区间,探索实时世界模型的
另有 1 家信源报道
智元与长隆在横琴长隆飞船乐园部署超300台人形机器人,打造全球首个大规模具身智能主题乐园,覆盖文娱商演、导览导购、服务零售等七大场景,并交付第20000台具身智能机器人A3 Ultra。机器人依托自研硅光动语WITA大模型和灵心平台实现多语言交互与角色定制,但现场仍需约3:1的人工配比,存在响应卡顿、嘈杂环境识别困难等问题。双方采用采购模式而非租赁,并联合中
科大讯飞于9月24日推出语音识别大模型Spark-ASR-2.0,基于全国产算力训练的语音基座模型Spark-Audio-1.0-Preview构建,重点提升通用识别、复杂声学场景识别、上下文识别和文本流畅规范性。该模型融合非自回归与LLM增强的自回归识别能力,通过投机解码实现先快速识别再重点纠错,推理成本较上代仅增10%,已上线讯飞输入法并通过讯飞开放平台
Black Forest Labs 发布面向机器人领域的开源 AI 模型 FLUX 3 Action,它基于多模态 FLUX 3 构建,属于 world-action 模型,可接收机器人工作区的多摄像头视频并预测下一步动作及环境变化。据 BFL 称,该模型仅用 70 亿参数就在 RoboLab-120 排行榜上创下成功率纪录,规模不到此前最佳开源模型的一半,
Google 将其 AI 驱动的虚拟衣橱功能推广至美国、巴西和印度的所有 iOS 与 Android 用户,该功能可根据照片中的穿着自动整理衣物并支持分类筛选与搭配。此次更新还伴随 Google Photos 的多项新功能,包括 Gemini Spark 单提示词选图、提亮与分享,升级版标记工具,以及更多 AI Remix 模板。Google 表示用户穿着数
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在原生实时对话模型基础上加入近实时视频生成能力,实现带口型同步、自然表情和流畅轮次切换的视觉化虚拟形象。该功能支持异步工具调用、97 种语言的原生语音到语音同步,并可通过参考图定制品牌形象,即日起在 Gemini Enterprise 上线。所有输出均嵌入
另有 1 家信源报道
AWS 发布 WhisperX 深度学习容器(DLC),在 SageMaker AI 上提供带说话人标注的语音转写能力。该容器封装了 OpenAI Whisper,并加入 wav2vec2 强制对齐实现逐词时间戳,以及说话人分离(diarization)功能,无需 Hugging Face token 即可部署。用户可将其部署到 SageMaker AI 实
Meta 在 Meta Connect 2026 上扩展了其 AI 智能体 Muse,新增实时视频聊天与可定制虚拟形象、专属邮箱地址以及控制 Mac 应用的能力,并计划未来数月让 Muse 运行在 Meta 智能眼镜上,将对话转化为添加购物清单、安排会议等操作。扎克伯格还发布了类似 Tamagotchi 的 Muse Charm 设备,配备 2 英寸屏幕、5
蔚来智能驾驶基础模型预研团队在任少卿指导下发布论文《MM-Future: Multi-Mode Joint World–Action Modeling for Autonomous Driving》,提出多模式世界—动作联合模型,可一次生成多组配对场景—动作假设并让场景与动作双向演化。在NAVSIM-v1上取得94.0 PDMS、NAVSIM-v2上取得91
百度搭子在2026 Intel Connection大会上宣布上线面向英特尔机型的本地Skill专区,并推出混合Skill调度能力,可根据任务类型和电脑算力在本地与云端之间自动选择处理方式。基于英特尔酷睿Ultra智能体PC,语音识别、文生图、文档和图片解析等任务可在本地完成,联网检索和复杂分析则由云端处理。此前百度搭子月活达674.30万,环比增长1063
诺因(Knowin)于9月24日发布面向通用具身智能的生成式学习架构GLOW技术报告,提出让机器人通过人类一次演示即可跨物体、跨环境、跨任务复用技能。GLOW由KnowinGLOW多模态自回归模型、KnowinDream经验合成引擎、KnowinWorld世界推演模块和KnowinAgent任务运行系统四部分组成。报告称其在RoboDojo、LIBERO-P
Meta在Connect 2026上发布Muse个人智能体,支持语音、实时视频和邮件功能,并推出多款AI眼镜硬件,包括Ray-Ban Meta Gen 3、VR眼镜和Muse Charm钥匙扣设备。Muse已超越ChatGPT登上App Store榜首,但Meta仅预告未发布新前沿模型。此外,Meta收购了语音初创公司WaveForms AI,并发布Muse
在2026年云栖大会上,斑马智能展示了以汽车作为具身智能“中试场”的路径,提出“意图经济”概念,即AI通过上下文与记忆读懂用户意图并直接调用服务。斑马智能座舱系统装车量达千万级,AI上车业务覆盖68%主流车企,并发布AutoOmni2.0-23B-A3B端侧大模型。其目标是将座舱验证的端云一体Agent架构与生态能力复制到手机、智能家居、机器人等终端。
该论文提出 Ovis-Embedding,一个基于 Qwen-Omni 预训练理解模型构建的全模态嵌入模型家族,通过共享多模态骨干网络将文本、图像、视频和音频编码到统一表示空间。研究采用低秩对比预训练、同源采样、focal loss 和嵌入蒸馏等训练优化策略,并在推理时用低秩特征分解实现紧凑嵌入。在 MMEB-v3、MMEB-v2、MVEB、MAEB 和 R
研究团队发布 AgroBench,一个可复现的多模态基准,用于弱监督作物产量学习。该基准将美国县级 USDA 作物产量统计与 Sentinel-2 光学影像、Sentinel-1 SAR、气候和地形数据结合,生成像素级作物时序,每个像素序列以县级产量作为弱监督信号。数据集包含 788,654 个作物像素、超 1300 万条观测,覆盖 2017–2024 八个
达特茅斯学院等机构的研究者提出 RCC-Align,一种跨模态对比学习框架,在训练阶段利用配对的病理全切片图像与 CT 数据,将组织形态学中的分级判别信息迁移到 CT 表征中。在 TCGA 和 CPTAC 队列上评估,RCC-Align 对低级别与高级别透明细胞肾细胞癌分类的 AUC 为 0.601,优于仅用 CT 的 DINOv2-Finetuned 基线
该研究提出一种用于胶质母细胞瘤(GBM)生存预测的多模态框架,将sheaf超图神经网络、概念瓶颈层和扩展充分性检验(EST)正则化器统一起来,以同时实现准确性和可解释性。在UPenn-GBM数据集593名患者的5折交叉验证中,模型达到0.643的一致性指数,且折间方差最低(std=0.015)。作者称这是首个将sheaf超图卷积、概念瓶颈监督与EST正则化结
豆包在一个月内第二次向所有用户免费发放订阅权益,用户下载或升级豆包工作电脑版或豆包电脑版即可领取30天订阅,已领取过上一轮福利的用户在权益到期期间会获得下一轮30天免费订阅,付费用户权益自动延期。豆包工作自8月25日发布后迭代迅速,新增多Agents并行、GUI操作电脑、本地Office文件编辑等功能,豆包2.1 Pro模型也完成版本升级,在多模态编程方面表
Meta在年度Connect大会上宣布为其个人AI代理Muse推出一系列新功能与集成,包括可实时视频对话的数字虚拟形象(由新模型Muse Realtime Avatar驱动)、接入Meta智能眼镜、支持Mac桌面操作、专属邮箱地址,以及与Stripe、Shopify、PayPal、Best Buy、Walmart等零售和支付伙伴的合作。Muse由多模态模型M
Meta 宣布正在将刚发布不久的 AI 智能体 Muse 引入其智能眼镜,包括在 Meta Connect 上发布的新款眼镜,用户可通过语音唤醒 Muse 来完成健身指导、记录饮食、购物等任务。同时 Meta 还为眼镜带来听力增强(FDA 认证)、更丰富的视觉问答、音频左右耳调节、Dolby Atmos 空间音频录制、动态照片等无障碍与影音功能。Meta R