返回主题地图

多模态

技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 777 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月13日周四 · 12 条
正文结构化主题已通过公开置信门槛
The Verge AI商业

Google 在 AI 竞赛中落后了吗?DeepMind 重组引发行业热议

Google 宣布重组其 AI 部门 Google DeepMind,首席科学家 Jeff Dean 离职创业,DeepMind 联合创始人兼 CEO Demis Hassabis 将卸任 CEO 并专注于长期研究。The Verge 高级 AI 记者 Hayden Field 在 Decoder 节目中分析了这一变动,认为尽管 Google 拥有巨大资源和

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

AdvNav:黑盒攻击揭示视觉语言导航系统的潜在安全风险

香港科技大学(广州)陈昶昊教授团队提出 AdvNav,这是首个面向视觉语言导航任务的黑盒行为引导对抗攻击框架,无需访问模型内部参数,仅通过观察智能体行为即可生成扰动。在 R2R 数据集上,AdvNav 对 HAMT 和 MapGPT 模型分别取得 49.70%、65.96% 和 87.30% 的攻击成功率,揭示了当前视觉语言导航系统普遍存在的视觉脆弱性。该研

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

视觉工具使用的幻觉:对图像思维模式的因果审计

该研究对多模态大语言模型的视觉工具使用进行了因果审计,发现尽管聚合准确率有所提升,但返回的视觉证据往往对答案没有因果影响,或调用计划不连贯。研究提出了视觉证据增益等干预指标,并在六个模型和五个基准上揭示了两种失败模式,将这种不一致称为视觉工具使用的幻觉。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

NeuPAT:面向语言保持多模态大模型的神经元感知可塑性分配调优

NeuPAT提出了一种神经元感知的可塑性分配调优框架,用于在多模态指令调优过程中保留大语言模型的语言能力。该方法通过小规模探测阶段估计神经元适应模式,选择性保护语言敏感神经元,同时促进多模态适应。实验表明,NeuPAT在11个语言基准上恢复了94.5%的语言能力退化,同时保持了相当的多模态性能。

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

自进化代码图像推理:通过可执行反思提升视觉计算能力

该研究提出Code-with-Image范式,将视觉推理从语言链转移到Python程序执行,并构建CwI-Bench基准测试。作者提出Self-Reflection over Executable Reasoning,一种无需训练的自我进化循环,通过观察和可执行反射改进技能库,显著提升GPT-5.6-luna和Qwen3.5-27B在基准上的准确率,且技能可

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

GeoUniPR:几何一致的跨模态地点识别统一框架

GeoUniPR 提出了一种几何一致的跨模态地点识别框架,通过将 LiDAR 点云投影到相机视角构建多通道深度图像视图,并利用参数高效微调的 ViT 编码器学习统一嵌入空间,无需复杂的对齐模块或多阶段训练。实验表明,GeoUniPR 在 KITTI 和 KITTI-360 数据集上达到了最先进的性能,并具有良好的跨数据集泛化能力。

正文结构化主题已通过公开置信门槛
Vercel AI SDK Releases一手来源产品发布

Vercel AI SDK 更新 Moonshot 提供商,支持视频输入

Vercel AI SDK 发布了 @ai-sdk/moonshotai@2.0.45 更新,该版本不再基于 @ai-sdk/openai-compatible,而是由包自身实现聊天功能,并支持视频输入,将视频文件转换为 Moonshot 的 video url 内容部分。同时,音频和 PDF 文件部分现在会在客户端抛出错误,并新增了 promptCache

正文结构化主题已通过公开置信门槛
量子位产品发布

荣耀发布全球首款机器人手机Robot Phone,开启具身交互时代

荣耀于2026年8月12日发布全球首款机器人手机荣耀Robot Phone,该手机配备四自由度钛合金灵巧云台和系统级Agent架构,支持多模态具身交互。荣耀与ARRI合作引入电影级影像技术,并搭载第五代骁龙8至尊版平台,售价9999元起。该产品旨在推动AI终端从数字智能迈向具身智能,开启人机伙伴关系新阶段。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

MBA:面向真实世界商业构思的多模态基准与智能体

研究人员推出了MBA-Bench,这是首个用于训练和评估商业构思智能体的多模态基准,包含六个领域的3万个样本。他们提出了MBA-b和MBA-k模型,通过LoRA微调和组相对策略优化,结合创造性和可行性奖励进行训练,显著优于文本和多模态基线。MBA-b和MBA-k分别比多模态基线提升25.6%和35.8%。

正文结构化主题已通过公开置信门槛
Simon Willison's Weblog模型发布

DeepSeek V4 Pro 0813 发布,仅限 API 访问

DeepSeek 发布了 V4 Pro 0813 模型,目前仅通过 API 提供,OpenRouter 已上线。作者推测其开放权重可能发布,因为前代模型均有权重。该模型在不同推理级别下生成的鹈鹕图像差异显著,且基准测试结果通过非官方渠道传播。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源模型发布

Cohere 发布 2.4B 原生分辨率视觉语言模型 North Micro Vision

Cohere 发布了 North-Micro-Vision-Instruct,一个 2.4B 参数的开源视觉语言模型,支持原生分辨率图像输入,采用 Apache 2.0 许可证。该模型结合了 400M 参数的视觉编码器和 2B 参数的语言模型,通过四阶段训练优化了文档理解、多语言视觉理解等能力。模型旨在支持边缘设备和移动端部署,并可通过微调适应特定领域。

正文结构化主题已通过公开置信门槛
Microsoft Research Blog一手来源研究

MindTopo基准揭示多模态模型空间推理短板

微软研究院推出新基准 MindTopo,用于评估多模态大语言模型的拓扑推理能力,涵盖连通性、封闭、顺序、分离和打结等概念。研究发现,当前模型在静态图像识别上表现较好,但在交互式规划任务中显著下降,错误多出现在规划阶段而非感知阶段。该基准旨在为机器人及交互环境中的 AI 系统提供诊断工具,并指出需要显式拓扑状态或保持拓扑的世界模型。

8月12日周三 · 8 条
正文结构化主题已通过公开置信门槛
TechCrunch AI产品发布

谷歌Made by Google 2026发布Pixel 11、Pixel Watch 5及Gemini新功能

谷歌在Made by Google 2026活动上发布了Pixel 11系列、Pixel Watch 5和Pixel Tag追踪器,并展示了多项Gemini驱动的功能。Pixel 11起售价899美元,Pro版起售价1099美元,均因RAM短缺而涨价。Pixel Tag定价29美元,兼容Android Find Hub网络。Gemini新增了手语翻译和Ram

正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源产品发布

Google 将手语 AI 集成到 Gboard 和 Live Transcribe

Google DeepMind 与 Android 团队合作,将手语识别技术 SL2T 集成到 Gboard 和 Live Transcribe 应用中,首先在 Pixel 11 上推出,免费使用。该项目与聋人社区合作开发,并成立了 AI 手语咨询委员会(AISLAC)以指导负责任部署。未来计划扩展至更多手语和手语生成功能。

正文结构化主题已通过公开置信门槛
量子位产品发布

国产具身智能创纪录:30%成本跑赢Figure AI,WALL-B模型成关键

自变量机器人在公开直播实测中,使用双机械臂和标准夹爪方案,以1816件/小时的分拣效率超过Figure AI的1248件/小时纪录,效率提升超45%,硬件成本降低70%。其核心是自研的WALL-B世界统一模型,该模型融合视觉、语言、动作等多模态信息,实现零样本泛化和实时决策。这一成果展示了通过模型能力而非复杂硬件提升机器人性能的路径,并已从家庭场景延伸至工业

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Jina AI 发布多模态嵌入模型 v5-omni-small

Jina AI 发布了 jina-embeddings-v5-omni-small,一个约 1.74B 参数的多模态嵌入模型,支持文本、图像、视频和音频输入,生成 1024 维共享向量空间嵌入,并与文本版 v5 模型对齐,无需重新索引即可跨模态检索。该模型支持检索、分类、聚类和文本匹配等任务,最大序列长度 32768,提供 Matryoshka 维度裁剪,并

正文结构化主题已通过公开置信门槛
量子位研究

紫东太初推出GMC剪枝法:减80%Token仍保多模态能力

中国科学院自动化研究所紫东太初大模型团队提出核心集剪枝方法GMC,通过互补证据自适应筛选与群体互补信息传输双阶段架构,在免训练、无额外依赖的情况下压缩视觉Token。实验表明,在Qwen2.5-VL-7B上减少80% Token仍保留97.78%能力,在LLaVA-1.5-7B上性能几乎无损,并减少KV Cache占用,提升推理速度。该方法可兼容主流视觉语言

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

InSight-doc:面向长文档理解的智能视觉感知框架

InSight-doc 是一种用于长文档理解的智能视觉感知框架,将视觉分辨率视为可自适应调整的推理时资源。它从低分辨率开始,无需外部检索器即可选择性放大高分辨率区域以获取更精细的证据。通过包含17.9K SFT示例和19.2K硬RL示例的训练,InSight-doc-8B在文档VQA基准上提升了4.3-16.4个准确率点,在长文档上将幻觉减少超过40%,推理

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Jina AI 发布多模态嵌入模型 v5-omni-small-retrieval

Jina AI 发布了 jina-embeddings-v5-omni-small-retrieval,这是一个多模态嵌入模型,支持文本、图像、视频和音频输入,并生成与文本模型对齐的共享向量空间。该模型约 1.56B 参数,嵌入维度 1024,支持最长 32768 序列,并可通过 Elastic Inference Service 或本地安装使用。该模型在图

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10369 发布:支持 pocket-tts 并优化性能

llama.cpp 发布 b10369 版本,主要更新是支持 pocket-tts 文本到语音模型。该实现将转置卷积重构为 GEMM 加 col2im,使 CUDA 上每帧生成时间降低 80%,CPU 上降低 50%,输出与参考实现高度一致。同时新增了语言包特定参数(如帧尾填充、短文本填充)和模型变体支持,并更新了文档。