返回主题地图

多模态

技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 775 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月4日周五 · 4 条
正文结构化主题已通过公开置信门槛
量子位模型发布

GPT Image 2.5泄露:可伪造GPT-6发布会,改进噪点问题

新版GPT Image 2.5生图模型已泄露,能伪造GPT-6发布会和奥特曼推文,文字和图像细节逼真。该模型改进了GPT Image 2的噪点问题,生成速度快,照片更真实,人脸和文字不易变形。目前尚未正式发布,但已在ChatGPT中弹出提示,并在LMArena竞技场以匿名模型出现。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-27B GPTQ W4A16 量化版发布:支持 vLLM 与视觉

pearsonkyle 发布了 Qwen3.8-27B 的 GPTQ W4A16 量化版本,基于 Qwen/Qwen3.8-27B,使用 32K 上下文校准,支持 vLLM 直接服务。该模型将 90.5% 参数量化为 int4,但嵌入和输出头保持 bf16,文件大小 18.1 GiB。模型内置 MTP 草稿头实现 1.71 倍解码加速,并保留视觉塔支持图像输

正文结构化主题已通过公开置信门槛
NVIDIA Generative AI Blog一手来源产品发布

NVIDIA IFA 2026加速本地AI:RTX Spark与多模型更新

在IFA 2026上,NVIDIA联合微软及合作伙伴宣布加速本地AI推理,推出RTX Spark迷你PC,并简化Hermes Agent、OpenClaw和Perplexity Portable Computer等应用的本地模型设置。同时发布了多项模型更新,包括Nemotron 3.5 Lightning、GLM-5.3-Flash、Qwen3.8系列等,并

正文结构化主题已通过公开置信门槛
The Verge AI产品发布

Google 推出 Gmail、Docs 和 Keep 的 AI 语音对话功能

Google 正在为 Gmail、Docs 和 Keep 推出 AI 语音助手模式,分别称为 Gmail Live、Docs Live 和 Keep Live,允许用户通过对话管理应用。这些功能支持免提获取信息、总结和转录,例如 Gmail Live 可从收件箱提取细节,Docs Live 可将想法格式化为结构化文档,Keep Live 可自然转录笔记。该功

9月3日周四 · 16 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

LFM2.5 模型家族发布,支持 React Native ExecuTorch

Hugging Face 上发布了 LFM2.5 模型家族,专为 React Native ExecuTorch 库设计,提供量化后的 .pte 格式文件,可直接在 ExecuTorch 运行时使用。该模型基于 LiquidAI 的 LFM2.5-VL-1.6B,支持图像与文本输入。用户需确保运行时与导出 .pte 文件所用的 ExecuTorch 版本兼容

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

清华与NVIDIA新研究:VLM大模型当具身教练,Gemini领跑,VLM-AR3L降本增效

国立清华大学与NVIDIA联合研究将Gemini 2.0、GPT-4.1等主流VLM大模型置于《我的世界》等具身任务中评估其视觉裁决能力,发现Gemini综合表现最佳,开源小模型在特定任务中反超。针对直接调用大模型的高成本和绝对打分缺陷,团队提出VLM-AR3L框架,通过双奖励融合与离线蒸馏将API查询降低约20倍,并在复杂任务中超越人类手写奖励。该研究为大

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

打破黑盒:SpatialSV 用 3D 几何监督提升大模型空间智能

中山大学团队提出 SpatialSV 方法,通过在多模态大模型隐藏层引入显式 3D 几何监督(深度图、射线图、点云图),提升空间智能,并利用开源 3D 模型自动生成监督信号,减少 50% 人工文本标注。实验表明该方法能可视化模型内部表征,诊断空间推理缺陷,并在半监督条件下接近全量标注性能,为具身智能训练提供低成本路径。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

Puffin-World:原生3D世界状态驱动的统一多模态模型

Hugging Face 博客介绍了 Puffin-World,一个统一的多模态世界模型,通过原生表示物理(重力场和纬度)、几何(深度)和外观(RGB)状态,实现相机到世界的理解、可控文本到图像生成、3D 世界生成和重建。该模型采用 Omni-Camera 表示,结合绝对和相对相机信息,并利用 Puffin-16M 数据集进行扩展,旨在推动多模态模型从 2D

正文结构化主题已通过公开置信门槛
Meituan Technical Team一手来源研究

美团智播数字人直播技术突破:从高保真形象到万路并发

美团技术团队在2026年中国互联网大会上展示了美团智播数字人直播解决方案,该方案融合大模型、数字人与多模态交互技术,实现高保真形象生成、自然动作驱动、语音手势协调及高效推理部署,使数字人直播月日均GTV同比增长82.12%,开播场次提升11倍。团队自研的SDIP、SREdit、MoTiGA、StreamingTalk及Glance2Gaze等技术分别被ACM

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering模型发布

Cohere 发布 Parse 5 多模态模型,提升复杂文档信息提取效率

Cohere 于 2026 年 8 月 27 日发布了 Parse 5,一个 23 亿参数的多模态视觉语言模型,旨在从复杂企业文档(如 PDF)中提取结构化数据并转换为 Markdown,同时提供边界框坐标用于视觉定位。该模型基于开源的 North-Micro-Vision-Instruct 架构,在 ParseBench 基准上平均得分 79.2,优于 M

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

Skim and Skip:高效多模态检索的分层自适应推理框架

清华大学、微软和上海交通大学的研究者提出了 Skim and Skip (SAS) 框架,用于提升多模态检索的效率。该框架通过基于 [EOS] 的 token 级信息选择和自适应深度推理,在 12 个 MMEB 检索任务上保留了约 99% 的密集基线性能,同时实现了最高 1.64 倍的端到端加速和 66.3% 的 FLOPs 减少。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

MemeCULT-1K:评估多模态模型的南亚文化语境与幽默理解

研究人员推出MemeCULT-1K基准,包含1000个南亚多语言梗图(孟加拉语、英语、印地语),并附带文化背景注释和人工解释。评估13个视觉语言模型发现,提供文化上下文能显著提升解释质量,平均SBERT相似度从44.6升至56.4。错误分析显示闭源模型主要失败于实体和指代识别,开源模型受限于文化知识缺口,语言和音韵错误最难通过上下文修正。数据集和代码已公开。

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

Cue2Narrate:重新思考电影音频描述生成

该研究提出Cue2Narrate,一种两阶段音频描述生成管道,用于长电影片段,同时预测视觉线索窗口和语音叙述窗口。作者引入LongLSMDC基准,包含长达8分钟的电影片段,并证明Cue2Narrate在定位和生成性能上优于基线。

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

FairLens:评估视觉语言模型在高风险决策中的公平性

arXiv 论文提出 FairLens,一个用于评估视觉语言模型在高风险决策(招聘、法律、医疗)中公平性和有效性的基准框架。该框架结合真实人脸图像与封闭/开放问题,从四个视角评估八个 VLM,发现主要失败模式是无根据推断而非不平等对待,且法律和医疗领域问题最严重。研究强调仅靠差异指标不足,需结合合理性评估,并指出自由文本偏见与多项选择准确性关联松散。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10775 发布:修复 idefics3 预处理

llama.cpp 发布 b10775 版本,主要修复了 idefics3 预处理问题(PR #28273)。该版本提供了适用于 macOS、Linux、Windows、Android 等平台的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10773 发布:服务器支持视频音频 data URL

llama.cpp 发布 b10773 版本,主要更新是服务器端支持 input video 和 input audio 的 data: URL,与 image url 保持一致,并允许视频/音频 MIME 类型。同时简化了 handle media 函数,移除了未使用的 accept base64 uri 标志,并增加了对无效 data URI MIME

正文结构化主题已通过公开置信门槛
Gemini API Release Notes一手来源模型发布

Google 发布 Lyria 3.5 音乐生成模型正式版

Google 在 Gemini API 中正式发布下一代音乐生成模型 Lyria 3.5(lyria-3.5),进入 GA 阶段。该模型支持生成长度完整的歌曲,在音乐连贯性、自然人声以及时长与结构控制方面有所提升,并支持文本和图像输入,输出 44.1 kHz 高保真立体声音频。

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

AWS 在澳大利亚推出 Bedrock 上的 OpenAI GPT-5.6 跨区域推理

AWS 宣布澳大利亚的悉尼和墨尔本区域现可通过 Amazon Bedrock 的全球跨区域推理访问 OpenAI GPT-5.6 系列模型(Sol、Terra、Luna)。这些模型支持文本和图像输入、100 万 token 上下文,并可通过 Responses API、Chat Completions API 和 Converse API 调用。文章还介绍了

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10766 发布:修复 DeepSeek4 视觉输入支持

llama.cpp 发布 b10766 版本,主要修复了 deepseek4 模型的视觉输入支持问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10762 发布,支持 DeepSeek-V4-Flash-Vision-Exp

llama.cpp 发布 b10762 版本,主要更新是支持 DeepSeek-V4-Flash-Vision-Exp 模型,包括处理最小/最大 token 数、使用 GGML ROPE TYPE VISION 等。该版本提供了多平台预编译二进制文件,涵盖 macOS、Linux、Windows、Android 等。