返回主题地图

多模态

技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 775 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月31日周一 · 7 条
正文结构化主题已通过公开置信门槛
正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

PACE:基于智能体自动化的发布者自适应内容提取

PACE 是一个用于网页内容提取的智能体框架,通过 LLM 分析页面结构并学习发布者特定的提取配置,在推理时使用固定确定性提取器模板,无需额外 LLM 调用。实验表明,PACE 在文章正文、元数据和多模态提取上优于可扩展的非人工基线,接近人工构建的发布者特定解析器质量。该框架旨在自动化发布者特定提取,为 LLM 数据管道提供可扩展的页面表示。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

SciReC:多模态多轮关系推理的自适应诊断评估

arXiv 论文提出 SciReC,一个模型自适应的多模态学术对话基准,用于评估多模态大语言模型在八类关系推理上的表现,并引入 DMRA 诊断框架以量化视觉理解、知识、记忆和推理等成分的贡献。结果显示 Claude 4.6 总体关系得分最高(73%),GPT 5.4 次之(68%);开源模型在空间关系上最弱,闭源模型在层级和顺序关系上更吃力;所有模型的主要错

正文结构化主题已通过公开置信门槛
Mistral Platform Changelog一手来源模型发布

Mistral 发布 Large 2.1 与 Pixtral Large,Le Chat 新增多项功能

Mistral 于 11 月 18 日发布了 Mistral Large 2.1 和 Pixtral Large 模型,后者为多模态模型,支持文档和图像理解。同时,Le Chat 平台新增了带引用的网络搜索、画布功能、图像生成(由 Black Forest Labs 的 Flux Pro 驱动)以及更快的响应速度。

正文结构化主题已通过公开置信门槛
Mistral Platform Changelog一手来源模型发布

Mistral 发布 Mistral Small 4 与开源代码智能体 Leanstral

Mistral 发布了 Mistral Small 4,这是一个统一指令、推理和编码的多模态混合模型,支持 256k 上下文窗口。同时,Mistral 还发布了 Leanstral,这是其首个面向 Lean 4 形式化证明工程的开源代码智能体。

正文结构化主题已通过公开置信门槛
Mistral Platform Changelog一手来源模型发布

Mistral 发布多模态模型 Medium 3.5,支持调节推理

Mistral 发布了 Mistral Medium 3.5,这是一个面向智能体和编码用例的前沿多模态模型,支持通过 reasoning effort 参数调节推理强度,并以修改版 MIT 许可证开放权重。

正文结构化主题已通过公开置信门槛
DeepSeek API Changelog一手来源模型发布

DeepSeek 发布多模态视觉模型 V4-Flash-Vision-Exp

DeepSeek 发布了实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,已上线 API 平台,用户可通过设置 model='deepseek-v4-flash-vision-exp' 访问。该模型在纯文本能力上与正式版持平,但在视觉理解的 Agent 基准测试中大幅提升,接近 Opus-4.8。

另有 1 家信源报道

8月30日周日 · 5 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

GLM-5.3-Flash NVFP4 量化版发布:体积缩减70%

LibertAI 发布了 GLM-5.3-Flash 的 NVFP4 量化版本,将模型从 598.5 GiB 压缩至 181 GiB,体积减少 70%,余弦相似度达 0.99665。该量化仅针对路由专家 FFN,保留注意力、视觉塔等关键部分为 BF16,确保多模态行为与原始模型一致。模型支持 vLLM 和 SGLang,但需要特定配置,且已修复 GB10 上

正文结构化主题已通过公开置信门槛
Xinference Releases一手来源产品发布

Xinference v3.3.0 发布:新增多模型支持与路由功能

Xinference 发布 v3.3.0 版本,新增了对多个模型的支持,包括 Qwen3.8、DeepSeek V4 Flash、GLM-Image、Kimi-K3 等,并引入了 token 感知的虚拟模型路由、Anthropic Messages 协议适配器、世界模型生成等新功能。此外,该版本还增强了音频、图像、视频等多模态能力,并修复了若干 bug。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

NaviDC-OCR:轻量级文档解析模型,统一数字与拍摄文档

StarDoc-AI 发布了 NaviDC-OCR,一个约 1.2B 参数的开源视觉语言模型,专为文档解析设计,统一处理数字和相机拍摄文档。该模型引入了多节点共识投票、几何感知建模、曲率引导采样等技术,在 OmniDocBench 和 Wild OmniDocBench 基准上达到最先进性能,且无需去畸变预处理。模型采用 Apache-2.0 许可证,支持中

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-27B INT4 量化模型发布:体积减半,速度提升58%

devan-carlin 发布了基于 Qwen3.8-27B 的 INT4 量化模型,使用 Intel AutoRound 方法,模型大小从约 52GB 减至 18GB。在 4 块 Intel Arc Pro B70 GPU 上通过 vLLM 张量并行运行,生成速度达 47.8 tok/s,比 BF16 快 58%,且保持质量一致。该模型支持多模态和 256

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Surge 发布 AriannaV4:基于 Gemma 4 的多模态本地助手

Surge 发布了 AriannaV4,一个基于 google/gemma-4-12B 与 Aria v4 权重合并的多模态本地助手模型。该模型采用核心权重加侧车架构,支持文本、推理、视觉、音频和视频理解,并提供 GGUF 量化版本供 llama.cpp、Ollama 和 LM Studio 使用。模型遵循 CC-BY-NC-SA 4.0 许可证。

8月29日周六 · 4 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Unsloth 发布 GLM-5.3-Flash GGUF 量化版

Unsloth 发布了 GLM-5.3-Flash 的 GGUF 量化版本,支持通过 llama.cpp 或 Unsloth Desktop 运行。GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,总参数 320B,激活参数 18B,采用混合架构和 mHC 技术,性能超越 GLM-5.2 且成本更低。

正文结构化主题已通过公开置信门槛
THE DECODER开源

LAION发布千万小时开放视频数据集BVD,助力AI研究

LAION发布了大型开放视频数据集Big Video Dataset(BVD),包含1000万小时视频,源自CommonCrawl中的13亿个视频URL,下载了8000万个视频并提取了5500万个片段及3亿张静态图像。基于BVD训练的模型在视频到文本基准测试中比InternVid训练的模型性能提升高达2.1个百分点。该数据集仅用于研究,LAION依据2024

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

模态成熟度指数:评估全模态模型多模态能力的基准

arXiv 论文提出 Modality Maturity Index (MMI) 基准,用于评估全模态模型在文本、图像、音频、视频和文档五种模态及其组合上的输入输出能力。MMI 包含 893 个问题,并引入 Modality Presence Score (MPS) 衡量模态生成能力。测试五个前沿模型发现 MPS 仅 15.6 至 34.9,表明现有模型多模

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

手术视频生成综述:从扩散模型到世界模型

这篇综述论文系统梳理了2024至2026年间手术视频生成领域的研究进展,将其分为无条件生成、条件生成和世界模型生成三类范式,揭示了从合成视觉上合理的帧到建模手术场景因果动态的任务定义转变。论文指出像素级保真度与临床合理性之间存在持续差距,并将泛化能力、物理真实性、可控性和可解释性视为主要瓶颈。该综述为智能感知、多模态融合、生成式AI和手术数据科学交叉领域的研

8月28日周五 · 4 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论观点

Sora 为何输给 Codex:算力调度与工作负载架构的差异

OpenAI CEO 奥特曼在播客中表示,Sora 因算力消耗巨大而优先级低于 Codex,资源向后者倾斜。文章分析认为,Sora 的算力集中在连续的视频生成路径中,难以复用,而 Codex 的 Agent 工作流可将算力碎片化,通过缓存、批处理和调度优化提高 GPU 利用率。这种架构差异导致两者扩张速度不同。

正文结构化主题已通过公开置信门槛
Latent Space产品发布

OpenAI预计2026年底实现AGI,多款AI产品发布

OpenAI首席科学家Jakub Pachocki表示,未发布的Astra模型已达到其2026年9月设定的“自动化AI研究实习生”目标,而Sama在《时代》采访中估计OpenAI将在2026年12月内部宣布实现AGI。此外,Hugging Face与Pollen Robotics联合推出399美元的开源双足机器人Microduck,支持模拟训练和强化学习定制

正文结构化主题已通过公开置信门槛
量子位商业

2026奇点智能技术大会北京站官宣,Transformer联合作者领衔

2026奇点智能技术大会北京站将于11月20-21日举行,由奇点智能研究院与CSDN联合主办。大会汇聚70余位技术专家,围绕18个前沿主题,涵盖大模型、AI原生软件研发、C++及系统软件等方向。OpenAI资深研究科学家、Transformer联合作者Łukasz Kaiser已确认发表主题演讲。

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

PrismRec:基于频谱分解的偏好流匹配微视频推荐框架

国防科技大学、新加坡国立大学和郑州大学的研究者提出 PrismRec 框架,用于微视频推荐。该框架通过频谱语义分解(SSF)将视频帧分解为静态语义和动态因子,并利用上下文校准偏好匹配(CPM)将用户敏感度作为条件注入生成过程。在四个数据集上的实验表明,PrismRec 相比最先进基线最高提升 22.65%,且推理成本和峰值内存最低。