返回主题地图

多模态

技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 775 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月2日周三 · 14 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10760 发布:修复 Qwen3-TTS 精度问题

llama.cpp 发布 b10760 版本,主要修复了 Qwen3-TTS-0.6B 模型在 mtmd 架构下的两个问题:一是将代码预测器的 proj in 权重设为可选加载,二是将 ffn down 层保持为 F32 精度,避免因 F16 溢出导致 NaN。该版本提供了多平台二进制文件,包括 macOS、Linux、Windows、Android 等。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

字节 Seed 大调整:数据与 RL 集中,产品按任务拆分

字节跳动旗下 Seed 基础模型团队进行重大组织调整,新设 Pretrain Data、Horizon RL、Product Posttrain-Work 和 Product Posttrain-Chat 四个一级部门,分别由李成刚、唐晟宇、秦禹嘉、朱文佳负责,均向吴永辉汇报。此次调整旨在合并相似工作、减少重叠,将分散的数据和强化学习能力集中,并按用户任务(

正文结构化主题已通过公开置信门槛
量子位产品发布

天工工作台新版上线:一站式AI短剧创作全流程工具

SkyProduction(天工工作台)于8月31日上线新版本,提供从剧本到成片的AI短剧创作全流程工具,包括剧本翻译、评分、小说转剧本、导演Agent、无限画布协作、片段重拍等功能,并支持多人团队协作和成本管理。该平台旨在降低AI短剧制作成本,提高创作效率,使创作者能持续生产完整作品。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Quillan-Ronin v5.4.0-oni:面向消费硬件的多模态分层MoE模型

CrashOverrideX 团队发布了 Quillan-Ronin v5.4.0-oni,一个面向消费级硬件的多模态分层网络混合专家模型,采用 BitNet 1.58-bit 三元量化、33 专家 MoE 和 9 向量语义棱镜等架构。该模型基于多个基础模型合并而成,支持文本、图像、音频和视频,并具备代理执行能力。模型目前处于训练暂停状态,最新检查点损失较高

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

双边状态空间模型用于非随机多模态评论反馈的序列推荐

本文提出了一种用于序列推荐的双边状态空间模型(TS-SSM),该模型同时建模用户和物品的动态状态,并利用多模态评论的缺失模式、局部图传播以及正负反馈的不对称结转效应来提升推荐性能。在六个亚马逊类别和Goodreads Fantasy数据集上的实验表明,TS-SSM在Recall@20指标上显著优于现有方法。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

REACH:通过LLM增强的音频-文本对齐实现零样本呼吸音分类

REACH框架通过LLM增强的音频-文本对齐,将自监督呼吸编码器转化为零样本能力的基础模型,在6个数据集的9项任务中平均零样本AUC达61.3%,超越CLAP和Qwen2-Audio,同时线性探测AUC达71.6%,仅使用全规模基线43%的数据。

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

分布式隐性危害:多模态大模型视频审核的组合安全盲点

该研究提出“分布式隐性危害”(DIH)概念,指多模态大模型在视频审核中无法识别由看似无害的片段组合而成的有害内容。作者构建了包含9000多个视频的DIH数据集和基准,测试30多个MLLM后发现即使最强模型检测率也低于45%,真实视频中同样失败。通过两阶段后训练,检测准确率提升超60个百分点,表明该缺陷可通过针对性训练缓解。

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

RAPIDMap:基于多智能体的快速可解释灾害制图管道

RAPIDMap 是一个由 Texas A&M University 提出的多智能体管道,用于从卫星和街景图像中快速生成可解释的灾害地图。该系统通过四个智能体(DPA、IRA、DRA、DMA)实现零样本灾害识别、图像恢复、损伤识别和空间映射,无需人工标注或微调。研究在多种灾害场景中验证了其泛化能力,旨在提升灾害响应的速度和准确性。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

OPPO联合OpenKG推出端侧AI记忆评测基准MobileMem

OPPO联合OpenKG社区及浙江大学、同济大学、东南大学等高校推出行业首个端侧AI记忆评测基准MobileMem,旨在为端侧AI记忆能力提供统一评测标准。该基准覆盖长期事件建模、跨模态推理和持续个性化适应等维度,数据集规模达百万词元,并已发布技术白皮书,后续将开源相关工具。此举有助于推动端侧AI记忆技术的标准化和生态发展。

正文结构化主题已通过公开置信门槛
量子位模型发布

李飞飞发布全球首个多模态世界模型Atlas

李飞飞创立的World Labs发布了全球首个多模态世界模型Atlas,该模型能够基于单张图片生成具有像素级相机控制的视频,并完成3D重建和时空模拟。Atlas采用多模态自回归扩散Transformer架构,支持机器人Real-to-Sim工作流,为具身智能训练提供新途径。目前Atlas已向部分合作伙伴开放早期访问。

正文结构化主题已通过公开置信门槛
Google AI一手来源产品发布

谷歌2026年8月AI新闻汇总:Gemini 3.7 Flash、Pixel 11等发布

谷歌在2026年8月发布了一系列AI更新,包括推出Gemini 3.7 Flash模型、Pixel 11系列手机、Gemini 3.5 Transcribe语音转文字模型、Gemini Omni 1.1 Flash视频生成模型,以及Gemini应用月活用户突破10亿。这些发布旨在提升AI的实用性、降低成本,并扩展在编码、教育、视频生成和气候预测等领域的应用。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

UNSEEN Gemma-4-26B NSFW 量化版发布

Jommarn 发布了基于 Google Gemma-4-26B-A4B-it 模型进行无审查化(abliteration)微调的 UNSEEN Gemma-4-26B NSFW 模型,并提供 2-bit 至 16-bit 的量化版本及 GGUF 格式,支持消费级 GPU 和 Apple Silicon 部署。该模型具备视觉能力,需配合视觉投影器使用,官方展

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

LuffyTheFox 发布基于 Qwen3.6 的无审查多模态 MoE 模型 Genesis Hermes V12

LuffyTheFox 发布了基于 Qwen3.6-35B-A3B 的无审查多模态 MoE 模型 GGUF 版本,采用其自研的 Genesis 算法对张量进行噪声修复,声称能提升模型稳定性和指令遵循能力。该模型融合了 Hermes 微调数据,支持多语言和视觉任务,并提供了量化脚本和推荐配置。

正文结构化主题已通过公开置信门槛
Google AI一手来源产品发布

谷歌推出Google Pics:集成于Workspace的AI图像编辑工具

谷歌宣布推出基于Nano Banana图像生成与编辑模型的Google Pics工具,面向Google AI Pro和Ultra订阅用户及多数Workspace商业客户。该工具提供对象分割、图像内文本编辑与翻译、协作编辑及多版本生成等功能,并集成到Slides、Docs和Drive中,使用户无需切换应用即可完成图像创作与编辑。

另有 2 家信源报道

9月1日周二 · 6 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

ISTA-DASLab 发布 Qwen3.8-27B 非均匀量化 GGUF 模型

ISTA-DASLab 发布了 Qwen3.8-27B 的 GSQ-RCO GGUF 量化版本,提供四种非均匀量化文件及视觉投影器,支持多模态使用。这些量化通过 GSQ 和 RCO 方法实现,在保持任务无损的同时显著减小模型体积,并兼容 llama.cpp、Ollama 和 LM Studio。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10737 发布:修复 qwen4exp 并新增测试

llama.cpp 发布 b10737 版本,主要针对 qwen4exp 架构进行修复,包括序列并行、块位置键控、多模态输入、CUDA 中止等问题,并新增了序列状态保存/恢复的测试。该版本还禁用了 qwen4exp 的 -sm tensor 支持,并提供了 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

MoziAI发布35B多模态模型,支持本地免费部署

MoziAI团队发布了MoziAI-35B-V3.8,一个基于Ornith-1.5-35B-A3B的开源多模态AI模型,支持本地部署,大小仅15.9GB。该模型集成了动态七维思考框架、Agent LOOP迭代机制、MoziSmartBit混合量化算法,并针对金融领域优化,支持免费商用。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

MiniMax-H3 发布 GGUF 量化版,支持 ComfyUI 多模态生成

Hugging Face 上发布了 MiniMax-H3 的 GGUF 量化版本,用于 ComfyUI。MiniMax-H3 是一个多模态生成系统,支持文本、图像、视频和音频的统一理解与生成,可生成带原生立体声的 2K 分辨率、最长 15 秒的视频。该模型提供多种变体,并支持通过 API 和在线应用使用。

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.27.0 发布:新增多模态评估与缓存功能

Langfuse 发布 v4.27.0 版本,新增多项功能,包括为追踪 IO 解析器添加功能开关、自托管 API 规范渲染器、缓存输入令牌和成本、MCP 评估器测试工具、多模态输入支持,以及为 Claude 在 OpenAI Responses 网关后添加提示缓存断点。同时修复了多个问题,如输出令牌截断、分析导出 URL 检查、提示版本指标维度等。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论开源

DeepSeek V4 多模态开源:视觉链路深度拆解

DeepSeek 开放了 V4 多模态模型的权重和推理代码,揭示了其视觉处理链路:通过 32 层 ViT 编码图像,使用 Aligner 将视觉特征压缩并映射到语言空间,视觉 Token 直接融入 V4 主干参与 Attention 和 MoE 路由。该设计针对 Agent 场景优化,支持长上下文和工具调用,但面临重复计算和视觉状态管理的挑战。