返回主题地图

多模态

技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 778 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月2日周日 · 18 条
正文结构化主题已通过公开置信门槛
xAI News一手来源模型发布

xAI 发布 Grok-2 和 Grok-2 mini 测试版,性能超越 GPT-4-Turbo

xAI 发布了 Grok-2 和 Grok-2 mini 的测试版,在聊天、编码和推理方面性能显著提升,在 LMSYS 排行榜上超越了 Claude 3.5 Sonnet 和 GPT-4-Turbo。这两个模型已在 X 平台上向 Premium 用户开放,并计划于本月晚些时候通过企业 API 提供给开发者。Grok-2 在视觉任务上表现出色,并与 Black

正文结构化主题已通过公开置信门槛
xAI News一手来源模型发布

xAI 发布 Aurora 图像生成模型,增强 Grok 多模态能力

xAI 宣布推出代号为 Aurora 的新型自回归图像生成模型,该模型采用混合专家网络,能够处理文本和图像交错数据,支持多模态输入,擅长生成逼真图像和精确遵循文本指令。Aurora 已在 X 平台的部分国家上线,并将在一周内向所有用户开放。xAI 还推出了 Grok Imagine API,提供视频生成、编辑和图像创建功能。

正文结构化主题已通过公开置信门槛
xAI News一手来源产品发布

xAI 免费开放 Grok-2 并推出新功能与 API 更新

xAI 宣布将改进后的 Grok-2 模型免费开放给所有 𝕏 平台用户,新模型速度提升三倍,并增强了准确性、指令遵循和多语言能力。同时,xAI 推出了 Grok 按钮、Aurora 图像生成模型等新功能,并更新了企业 API,新增 grok-2-1212 和 grok-2-vision-1212 模型,降低了 API 价格。

正文结构化主题已通过公开置信门槛
Mistral AI News一手来源模型发布

Mistral AI 发布 Voxtral 语音模型,开源且成本减半

Mistral AI 发布了 Voxtral 语音理解模型,提供 24B 和 3B 两种规模,均采用 Apache 2.0 许可证,并可通过 API 使用。该模型支持长上下文、多语言、问答、摘要和函数调用,在转录和音频理解基准上优于 Whisper 等模型,且成本低于同类 API。

正文结构化主题已通过公开置信门槛
Mistral AI News一手来源产品发布

Mistral AI 为 Le Chat 推出深度研究与语音等新功能

Mistral AI 为其 AI 助手 Le Chat 推出多项新功能,包括 Deep Research 预览模式、基于 Voxtral 模型的语音模式、由 Magistral 推理模型驱动的多语言推理、Projects 上下文文件夹,以及与 Black Forest Labs 合作的图像编辑功能。这些功能旨在提升用户的深度研究、自然交互和上下文管理体验,用

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源产品发布

Together AI 成为 MiniMax M3 首选云伙伴,实现高效推理优化

Together AI 宣布成为 MiniMax M3 的首选云合作伙伴,将在其公开发布后托管该开放权重模型。Together AI 的推理和内核团队通过多项优化,如 KV-Block-Major 稀疏注意力内核、MSA 的分页注意力集成等,实现了 81-125% 的吞吐量提升。MiniMax M3 支持 1M 上下文窗口和原生多模态,其稀疏注意力机制显著加

正文结构化主题已通过公开置信门槛
Cohere Blog一手来源模型发布

Cohere 发布开源 MoE 模型 Command A+,性能大幅提升

Cohere 发布了开源模型 Command A+,这是一个混合专家(MoE)模型,总参数 218B,激活参数 25B,支持 128K 上下文和 48 种语言,采用 Apache 2.0 许可证。该模型在推理、智能体任务、多模态和检索等企业工作负载上性能优于前代 Command A 系列,并可在低至两张 H100 或单张 B200 的硬件上高效运行。Comm

正文结构化主题已通过公开置信门槛
xAI News一手来源产品发布

xAI 发布 Imagine Video 1.5 更新,支持图像语音参考和1080p

xAI 发布了 Imagine Video 1.5 的更新版本,新增了图像和语音参考功能,支持文本、图像和语音生成视频,并原生支持 1080p 分辨率。该功能在美国率先面向 SuperGrok Heavy 和 SuperGrok Plus 用户推出,随后将向所有用户开放。同时,xAI API 也已支持图像参考、文本转视频和原生 1080p,语音参考需申请。

正文结构化主题已通过公开置信门槛
Mistral AI News一手来源模型发布

Mistral AI 发布 Voxtral TTS 多语言语音生成模型

Mistral AI 发布了 Voxtral TTS,一个 4B 参数的多语言文本转语音模型,支持 9 种语言,具有低延迟和情感表达。该模型可通过 API 和 Mistral Studio 使用,定价为每 1k 字符 0.016 美元,并支持零样本跨语言语音适应。

正文结构化主题已通过公开置信门槛
Mistral AI News一手来源模型发布

Mistral Small 4 发布:统一推理、多模态与编码的开源模型

Mistral AI 发布了 Mistral Small 4,这是其 Small 系列的新旗舰模型,首次统一了推理、多模态和智能体编码能力,支持文本和图像输入,并采用 Apache 2.0 开源许可。该模型基于 MoE 架构,总参数 119B,激活参数 6B,上下文窗口 256k,性能相比 Small 3 提升显著,推理延迟降低 40%,吞吐量提升 3 倍。

正文结构化主题已通过公开置信门槛
Mistral AI News一手来源模型发布

Mistral OCR 4 发布:支持边界框与置信度评分,性能领先

Mistral AI 发布了 Mistral OCR 4,这是一款文档解析模型,支持边界框、块分类和置信度评分,覆盖 170 种语言,并可在单容器中自托管部署。该模型在人类评估和 OlmOCRBench 基准上表现优异,价格低至每千页 2 美元(批量 API),适用于企业搜索、RAG 和代理工作流。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源产品发布

Hugging Face 博客新文章:Kimi K3 等模型发布与技术教程

Hugging Face 博客发布了多篇新文章,涵盖模型发布、技术教程和行业观点。其中重点介绍了 Kimi K3 模型,该模型拥有 2.8T 参数,采用 MXFP4 量化,并开放权重,对社区具有重要意义。其他文章涉及多语言检索模型、设备端视觉语言模型、物理 AI 模拟、FLUX 3 多模态模型、AI 预测模型开源、KV 缓存优化、RAG 幻觉预防等。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源模型发布

Thinking Machines 发布开源多模态模型 Inkling 及小型版

Thinking Machines Lab 发布了开源多模态模型 Inkling 及其小型版本 Inkling-Small。Inkling 拥有约 1 万亿参数,支持文本、图像和音频输入,具备 1M 上下文窗口和智能体能力,并已在 Hugging Face 上提供,支持 transformers、SGLang、vLLM 和 llama.cpp 等推理引擎。该

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
OpenAI API Changelog一手来源产品发布

OpenAI发布GPT-5.6系列及多项API更新

OpenAI 在2026年7月发布GPT-5.6模型系列,包括Sol、Terra和Luna,并大幅降低Luna和Terra的价格。同时推出API快速模式、官方Terraform提供商、GPT Transcribe和GPT Live Transcribe转录模型,以及组织级硬性支出限制。此外,还发布了GPT-Realtime-2.1及mini版本,改进实时推理

正文结构化主题已通过公开置信门槛
GLM New Releases一手来源模型发布

智谱AI发布多款新模型及产品更新

智谱AI发布了一系列新模型和产品,包括旗舰模型GLM-5.3、GLM-5.2、GLM-5.1、GLM-5、GLM-4.7等,以及多模态模型GLM-5.3-Flash、GLM-5V-Turbo、GLM-OCR等。这些模型在编程、长上下文、多模态理解等方面有显著提升,并推出了GLM Coding Plan团队版和AutoGLM-Phone框架。此外,还发布了语音

正文结构化主题已通过公开置信门槛
AI at Meta Blog一手来源模型发布

Meta 发布 Muse Image 并预览 Muse Video,具备智能体式图像生成能力

Meta 超级智能实验室发布了 Muse Image 并预览了 Muse Video,这是其首批媒体生成模型。Muse Image 具备智能体能力,能使用搜索和编码工具、自我优化,并支持多参考图像合成,已在 Meta AI 应用、meta.ai 等平台上线。Muse Video 提供高保真视频生成和原生音频支持,即将面向创作者推出。模型在 Arena 基准上

正文结构化主题已通过公开置信门槛
AI at Meta Blog一手来源模型发布

Meta 发布 Muse Spark 1.1 多模态智能体模型及 API 预览

Meta 推出 Muse Spark 1.1 多模态推理模型,显著提升智能体任务、工具使用、编码和多模态理解能力,并首次通过 Meta Model API 公开预览提供。该模型支持百万 token 上下文,可编排多智能体系统,在计算机使用和编码方面表现优异,同时通过安全评估。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源模型发布

Tether AI 发布 VisionPsy-Nano:边缘设备上的先进视觉语言模型

Tether AI Research 发布了 VisionPsy-Nano 系列紧凑型视觉语言模型(约 460M 参数),专为边缘设备设计,包含质量优先的 460M 和延迟优化的 460M-Flash 两个版本。该系列在 17 项基准测试中的 16 项上优于同类 0.5B 模型,并在推理、视觉感知等能力上超越更大模型。模型以 Apache 2.0 协议开源,

7月30日周四 · 2 条
正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源模型发布

谷歌发布 Gemini Robotics ER 2 具身推理模型,支持多机器人协作

Google DeepMind 发布 Gemini Robotics ER 2,这是其最强大的具身推理模型,旨在作为机器人的高级大脑,支持视频理解、任务编排和多机器人协作。该模型通过 Gemini API 和 Google AI Studio 向开发者公开,并已在 Gemini Enterprise Agent Platform 提供私有预览。Gemini

正文结构化主题已通过公开置信门槛