Google 在 AI 竞赛中落后了吗?DeepMind 重组引发行业热议
Google 宣布重组其 AI 部门 Google DeepMind,首席科学家 Jeff Dean 离职创业,DeepMind 联合创始人兼 CEO Demis Hassabis 将卸任 CEO 并专注于长期研究。The Verge 高级 AI 记者 Hayden Field 在 Decoder 节目中分析了这一变动,认为尽管 Google 拥有巨大资源和
技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 777 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Google 宣布重组其 AI 部门 Google DeepMind,首席科学家 Jeff Dean 离职创业,DeepMind 联合创始人兼 CEO Demis Hassabis 将卸任 CEO 并专注于长期研究。The Verge 高级 AI 记者 Hayden Field 在 Decoder 节目中分析了这一变动,认为尽管 Google 拥有巨大资源和
香港科技大学(广州)陈昶昊教授团队提出 AdvNav,这是首个面向视觉语言导航任务的黑盒行为引导对抗攻击框架,无需访问模型内部参数,仅通过观察智能体行为即可生成扰动。在 R2R 数据集上,AdvNav 对 HAMT 和 MapGPT 模型分别取得 49.70%、65.96% 和 87.30% 的攻击成功率,揭示了当前视觉语言导航系统普遍存在的视觉脆弱性。该研
该研究对多模态大语言模型的视觉工具使用进行了因果审计,发现尽管聚合准确率有所提升,但返回的视觉证据往往对答案没有因果影响,或调用计划不连贯。研究提出了视觉证据增益等干预指标,并在六个模型和五个基准上揭示了两种失败模式,将这种不一致称为视觉工具使用的幻觉。
NeuPAT提出了一种神经元感知的可塑性分配调优框架,用于在多模态指令调优过程中保留大语言模型的语言能力。该方法通过小规模探测阶段估计神经元适应模式,选择性保护语言敏感神经元,同时促进多模态适应。实验表明,NeuPAT在11个语言基准上恢复了94.5%的语言能力退化,同时保持了相当的多模态性能。
该研究提出Code-with-Image范式,将视觉推理从语言链转移到Python程序执行,并构建CwI-Bench基准测试。作者提出Self-Reflection over Executable Reasoning,一种无需训练的自我进化循环,通过观察和可执行反射改进技能库,显著提升GPT-5.6-luna和Qwen3.5-27B在基准上的准确率,且技能可
GeoUniPR 提出了一种几何一致的跨模态地点识别框架,通过将 LiDAR 点云投影到相机视角构建多通道深度图像视图,并利用参数高效微调的 ViT 编码器学习统一嵌入空间,无需复杂的对齐模块或多阶段训练。实验表明,GeoUniPR 在 KITTI 和 KITTI-360 数据集上达到了最先进的性能,并具有良好的跨数据集泛化能力。
Vercel AI SDK 发布了 @ai-sdk/moonshotai@2.0.45 更新,该版本不再基于 @ai-sdk/openai-compatible,而是由包自身实现聊天功能,并支持视频输入,将视频文件转换为 Moonshot 的 video url 内容部分。同时,音频和 PDF 文件部分现在会在客户端抛出错误,并新增了 promptCache
荣耀于2026年8月12日发布全球首款机器人手机荣耀Robot Phone,该手机配备四自由度钛合金灵巧云台和系统级Agent架构,支持多模态具身交互。荣耀与ARRI合作引入电影级影像技术,并搭载第五代骁龙8至尊版平台,售价9999元起。该产品旨在推动AI终端从数字智能迈向具身智能,开启人机伙伴关系新阶段。
研究人员推出了MBA-Bench,这是首个用于训练和评估商业构思智能体的多模态基准,包含六个领域的3万个样本。他们提出了MBA-b和MBA-k模型,通过LoRA微调和组相对策略优化,结合创造性和可行性奖励进行训练,显著优于文本和多模态基线。MBA-b和MBA-k分别比多模态基线提升25.6%和35.8%。
DeepSeek 发布了 V4 Pro 0813 模型,目前仅通过 API 提供,OpenRouter 已上线。作者推测其开放权重可能发布,因为前代模型均有权重。该模型在不同推理级别下生成的鹈鹕图像差异显著,且基准测试结果通过非官方渠道传播。
Cohere 发布了 North-Micro-Vision-Instruct,一个 2.4B 参数的开源视觉语言模型,支持原生分辨率图像输入,采用 Apache 2.0 许可证。该模型结合了 400M 参数的视觉编码器和 2B 参数的语言模型,通过四阶段训练优化了文档理解、多语言视觉理解等能力。模型旨在支持边缘设备和移动端部署,并可通过微调适应特定领域。
微软研究院推出新基准 MindTopo,用于评估多模态大语言模型的拓扑推理能力,涵盖连通性、封闭、顺序、分离和打结等概念。研究发现,当前模型在静态图像识别上表现较好,但在交互式规划任务中显著下降,错误多出现在规划阶段而非感知阶段。该基准旨在为机器人及交互环境中的 AI 系统提供诊断工具,并指出需要显式拓扑状态或保持拓扑的世界模型。
谷歌在Made by Google 2026活动上发布了Pixel 11系列、Pixel Watch 5和Pixel Tag追踪器,并展示了多项Gemini驱动的功能。Pixel 11起售价899美元,Pro版起售价1099美元,均因RAM短缺而涨价。Pixel Tag定价29美元,兼容Android Find Hub网络。Gemini新增了手语翻译和Ram
Google DeepMind 与 Android 团队合作,将手语识别技术 SL2T 集成到 Gboard 和 Live Transcribe 应用中,首先在 Pixel 11 上推出,免费使用。该项目与聋人社区合作开发,并成立了 AI 手语咨询委员会(AISLAC)以指导负责任部署。未来计划扩展至更多手语和手语生成功能。
自变量机器人在公开直播实测中,使用双机械臂和标准夹爪方案,以1816件/小时的分拣效率超过Figure AI的1248件/小时纪录,效率提升超45%,硬件成本降低70%。其核心是自研的WALL-B世界统一模型,该模型融合视觉、语言、动作等多模态信息,实现零样本泛化和实时决策。这一成果展示了通过模型能力而非复杂硬件提升机器人性能的路径,并已从家庭场景延伸至工业
Jina AI 发布了 jina-embeddings-v5-omni-small,一个约 1.74B 参数的多模态嵌入模型,支持文本、图像、视频和音频输入,生成 1024 维共享向量空间嵌入,并与文本版 v5 模型对齐,无需重新索引即可跨模态检索。该模型支持检索、分类、聚类和文本匹配等任务,最大序列长度 32768,提供 Matryoshka 维度裁剪,并
中国科学院自动化研究所紫东太初大模型团队提出核心集剪枝方法GMC,通过互补证据自适应筛选与群体互补信息传输双阶段架构,在免训练、无额外依赖的情况下压缩视觉Token。实验表明,在Qwen2.5-VL-7B上减少80% Token仍保留97.78%能力,在LLaVA-1.5-7B上性能几乎无损,并减少KV Cache占用,提升推理速度。该方法可兼容主流视觉语言
InSight-doc 是一种用于长文档理解的智能视觉感知框架,将视觉分辨率视为可自适应调整的推理时资源。它从低分辨率开始,无需外部检索器即可选择性放大高分辨率区域以获取更精细的证据。通过包含17.9K SFT示例和19.2K硬RL示例的训练,InSight-doc-8B在文档VQA基准上提升了4.3-16.4个准确率点,在长文档上将幻觉减少超过40%,推理
Jina AI 发布了 jina-embeddings-v5-omni-small-retrieval,这是一个多模态嵌入模型,支持文本、图像、视频和音频输入,并生成与文本模型对齐的共享向量空间。该模型约 1.56B 参数,嵌入维度 1024,支持最长 32768 序列,并可通过 Elastic Inference Service 或本地安装使用。该模型在图
llama.cpp 发布 b10369 版本,主要更新是支持 pocket-tts 文本到语音模型。该实现将转置卷积重构为 GEMM 加 col2im,使 CUDA 上每帧生成时间降低 80%,CPU 上降低 50%,输出与参考实现高度一致。同时新增了语言包特定参数(如帧尾填充、短文本填充)和模型变体支持,并更新了文档。