返回主题地图

多模态

技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 776 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月20日周四 · 3 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

OpenMOSS发布MOSS-VL-Instruct-0408多模态模型

OpenMOSS团队发布了MOSS-VL-Instruct-0408,这是一个基于MOSS-VL-Base-0408进行监督微调的多模态视觉语言模型,支持图像理解、长视频理解和实时流式交互。该模型采用交叉注意力架构和绝对时间戳,在视频理解基准上表现优异,如VideoMME和MLVU,并在视频理解上超越Qwen3-VL。模型已开源,采用Apache-2.0许可

正文结构化主题已通过公开置信门槛
TechCrunch AI产品发布

谷歌为Search和Gemini推出AI学习工具套件

谷歌在Search和Gemini中推出了一系列新的学习工具,包括AI生成的交互式可视化、3D模拟、定制练习测验和专门的学生中心。这些功能旨在让Gemini成为学生学习和备考的首选AI助手,与OpenAI及教育初创公司Knowt和Gauth等竞争。用户可以在Search中生成定制测验和交互式学习体验,在Gemini中启动多步骤研究报告并对话式讨论结果,还能生成

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源研究

NVIDIA FLARE 构建联邦多模态 AI 工作流

NVIDIA 技术博客介绍了如何使用 NVIDIA FLARE 构建联邦多模态 AI 工作流,重点讨论了跨网络传输的模型状态以及高效传输和聚合的方法。文章通过 FedUMM 示例展示了在冻结的多模态骨干上联邦轻量级适配器,并利用外部化、张量流和磁盘支持聚合来处理大型模型更新。该工作流支持参数高效和全模型通信模式,解决了数据分布在不同机构时的训练挑战。

8月19日周三 · 12 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

清华王鑫团队独揽IJCAI 2026两大Tutorial,聚焦OOD泛化

清华大学王鑫教授团队在IJCAI 2026上罕见地同时入选两个Tutorial,主题分别为图分布偏移和OOD泛化生成式AI,旨在解决生成式模型在真实世界分布外场景下的泛化问题。该团队提出结合图大语言模型、动态适应和因果不变性的三维解法,并强调后训练策略以提升鲁棒性。这标志着生成式AI技术竞争从IID拟合转向OOD泛化,彰显清华在该领域的国际影响力。

正文结构化主题已通过公开置信门槛
量子位商业

MiniMax核心工程负责人阿岛离职

MiniMax核心工程负责人阿岛(缪宇航)已离职,其飞书状态显示离职,下一站未公开。阿岛曾负责M3.x、Agent、Audio及海螺AI等关键业务,并多次代表团队对外解释技术路线。他的离职发生在MiniMax重押Coding和Agent的关键时期,其职责交接情况尚不明确。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

杰富瑞实测:阿里千问办公Agent综合排名第一,超越Claude Cowork和Codex

华尔街投行杰富瑞实测八款全球主流AI Agent,结果显示阿里千问办公综合得分第一,超越Claude Cowork和Codex。测试涵盖五项真实办公任务,千问办公在复杂任务、浏览器控制及多模态生成中表现突出,且隐含Harness分居首。报告指出,Agent竞争正转向企业级场景,成本与生态协同成为关键。

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论模型发布

英伟达发布 Cosmos 3 世界基础模型,欲统一具身智能全模态

英伟达在悉尼 RSS 2026 上发布 Cosmos 3,这是一个面向物理 AI 的多模态世界基础模型,在单一 Transformer 架构下统一了文本、视觉、音频和动作模态。Cosmos 3 提供 Edge(4B)、Nano(16B)和 Super(64B)三个版本,支持世界理解、未来模拟和动作执行,并完全开源。英伟达物理 AI 专家 Max Li 在演讲

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

第10届AI City Challenge:城市智能基准十年回顾

第10届AI City Challenge在ECCV 2026上举办,吸引了325支队伍和26个国家和地区参与,较2025年显著增长。挑战赛涵盖多摄像头3D感知、交通场景理解、异常事件推理等六个主要赛道,并新增两个域外排行榜。成功的系统通常结合基础模型与几何约束、检索或重排序、合成数据设计、域适应和受控推理。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

边际正则化结构化语义对齐用于脑语言对应研究

本文提出 MD-SigLIP 框架,通过边际正则化的结构化语义对齐,将脑磁图信号与文本嵌入映射到共享语义空间,实现基于检索的脑语言解码。该方法在 D-SigLIP 基础上引入列表式边际正则项,建模多正例语义簇和排序约束,在两个 MEG 语言数据集上取得最优检索性能,且不依赖生成式语言模型。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

多模态大语言模型中的不确定性感知决策:来源、信号、校准与行动综述

这篇综述围绕多模态大语言模型(MLLM)中的不确定性感知决策展开,提出了一个以决策为中心的框架,将不确定性来源、信号、校准和行动联系起来。文章指出,MLLM 的不确定性不仅源于语言,还涉及视觉、文本、时间、声学等多模态证据的质量和冲突,并强调不确定性评估应关注其能否改善系统在证据不足或冲突时的行为。综述涵盖了校准、选择性回答、弃权、澄清、检索等行动策略,并总

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

YCWTG 发布 gemma-4-31B-it 的 NVFP4A16 量化版

YCWTG 发布了基于 google/gemma-4-31B-it 的 NVFP4A16 量化版本模型,使用 llm-compressor 生成,模型大小从 62.6GB 降至 20.5GB,同时保持接近原版的推理性能(HLE 得分 18.1 vs 19.5)。该模型支持指令模式和思考模式,并针对视觉塔和 lm head 层保留了 16 位精度以减少多模态性

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

ThinkingCap-Qwen3.6-27B 推出 GGUF 量化版本

mradermacher 发布了 ThinkingCap-Qwen3.6-27B 模型的 GGUF 量化版本,该模型基于 bottlecapai 的 ThinkingCap-Qwen3.6-27B,支持多模态。提供了从 Q2 K 到 Q8 0 的多种量化格式,并附有使用说明和量化质量对比。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-27B NVFP4 MTP GGUF 发布:八种精度文件支持视觉与投机解码

esatapedico 发布了 Qwen3.8-27B-NVFP4-MTP-GGUF,包含八个 GGUF 文件,针对 Blackwell 硬件优化,保留了 NVFP4 密度并内置 MTP 投机解码头。该模型是原生视觉语言模型,支持图像和视频,原生上下文长度 262,144。不同文件在精度和大小上有所区分,以适应不同显存需求。

正文结构化主题已通过公开置信门槛
智东西产品发布

闪极发布AI眼镜loomos L1:40克重,续航40小时,2699元起

闪极于8月18日发布新款AI眼镜loomos L1,重约40克,综合续航40小时,支持主动AI记忆和AI日记,可接入飞书、腾讯WorkBuddy等Agent生态,售价2699元起。该产品历时两年研发,投入超1亿元,旨在解决上代产品的交付问题,但能否成功仍待市场检验。

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源教程

使用 Amazon Bedrock 实现向量提示文档分类

AWS 博客介绍了一种基于 Amazon Bedrock 的多智能体文档分类方案,用于保险行业对政策、宣誓书等文档进行准确分类。该方案使用 Strands Agents SDK 编排三个智能体:文档分析智能体(基于 Claude Haiku 4.5)、向量相似性搜索智能体(基于 Titan Multimodal Embeddings 和 FAISS)以及验证

8月18日周二 · 5 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

奕境X9开启预售,华为乾崑全栈赋能第二代家庭旗舰

东风与华为乾崑合作的新能源汽车品牌奕境,于2026年8月18日发布首款车型奕境X9,预售价29.98万元起。该车搭载华为乾崑全栈六大智能解决方案,包括ADS 5智驾、鸿蒙座舱HarmonySpace 6等,主打家庭出行安全与智能体验。华为高管靳玉志表示,乾崑智驾辅助驾驶安全里程达950万公里,累计突破140亿公里。

正文结构化主题已通过公开置信门槛
量子位产品发布

Current Robotics发布世界仿真器CurrentWorld-0

Current Robotics团队发布了交互式世界仿真器CurrentWorld-0,首次将跨本体、多视角和力-触觉预测集成于同一系统,用于机器人评测。该仿真器确保机器人动作与环境响应一致,支持多视角同步生成和力触觉反馈,并允许人类遥操作接管。团队创始人祝毅晨曾任职美的集团,其工作被Physical Intelligence的π0引用。

正文结构化主题已通过公开置信门槛
量子位模型发布

阿里发布AI音乐模型HappyShrimp,实现端到端整曲生成

阿里巴巴于8月17日发布AI音乐模型HappyShrimp,该模型能通过自然语言描述完成作词、作曲、编曲到演唱的完整创作,采用端到端整曲生成技术。上线首日与太合音乐集团达成战略合作,并同步上线PC网页端。

正文结构化主题已通过公开置信门槛
The Verge AI产品发布

苹果带摄像头AirPods泄露视频曝光,支持视觉智能

苹果带摄像头的AirPods在macOS Tahoe 26.7 Release Candidate的泄露视频中首次亮相,视频展示了用户通过视觉智能识别书籍封面。该产品旨在为Siri提供低分辨率视觉信息,支持导航和问答功能,预计与改进版Siri及新一代iPhone在9月一同发布。

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

MAPLE:多角度全文科学论文检索基准

研究人员提出了MAPLE基准,用于评估检索器能否从多个方面(如动机、方法和实验结果)一致地检索同一篇科学论文。MAPLE包含2095个查询,涉及210篇近期机器学习和NLP论文,并提出了MAPLE-Synth流水线来生成逼真的查询。实验表明,最强模型在AnyAspect@20上达到98.1%,但在AllAspect@20上仅为15.7%,揭示了多角度检索的显