返回主题地图

多模态

技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 40

8月12日星期三 · 6
TechCrunch AI商业12

谷歌Gemini应用月活用户突破10亿

谷歌CEO桑达尔·皮查伊宣布,Gemini应用月活跃用户数突破10亿,成为谷歌第14个达到此里程碑的产品。Gemini的增长速度与OpenAI的ChatGPT相当,后者在6月达到10亿用户。谷歌持续将Gemini整合到搜索、工作空间、安卓等产品中,并推出Gemini 3.5 Flash模型以提升编码和AI代理任务能力。此外,63%的用户使用语音功能,Gemi

Google Research Blog一手来源研究23

Google 推进 AMIE 实现专家级视听临床咨询

Google Research 在博客中宣布其医疗 AI 系统 AMIE 升级为支持实时视频问诊的 AMIE (Video),基于 Gemini 和 Project Astra 构建,采用异步多智能体架构以平衡对话速度与深度推理。在包含 100 个场景、300 次实时咨询和 30 名认证医生的随机对照研究中,AMIE (Video) 首次展示了专家级表现,并

另有 1 家信源报道

Google AI一手来源研究23

谷歌医疗AI系统AMIE首次实现实时临床视频咨询

Google Research 与 Google DeepMind 在首次研究中展示了其医疗 AI 系统 AMIE 的实时临床视频咨询能力。该系统基于 Gemini 和 Project Astra 构建,采用多智能体架构,能够解读视觉和听觉线索,指导虚拟体检并进行实时诊断推理。在模拟咨询的随机研究中,临床评估者对其病史采集、诊断准确性、管理适当性和沟通质量给

另有 1 家信源报道

The Verge AI产品发布18

苹果开发新功能验证iPhone照片真实性,对抗AI深度伪造

苹果正在开发一项名为“Apple Reference Image”的iOS功能,可在拍摄时向iPhone照片嵌入来源元数据,以帮助用户证明照片非AI伪造。该功能在iOS 27测试版中被发现,默认关闭,用户需手动启用,并通过苹果的Private Cloud Compute服务器进行验证。苹果未采用C2PA标准,而是自建系统,这可能为在线平台标记人类创作内容提供

AWS Machine Learning Blog一手来源产品发布33

Pixieset 借助 Amazon Bedrock 实现 35% AI 功能采用率

Pixieset 通过 Amazon Bedrock 开发了 AI 图像替代文本生成功能,解决了摄影师为大量图片手动编写 alt text 的痛点。该功能在 4 个月内从概念到上线,首周为超过 75 万张照片生成了替代文本,并实现了 35% 的用户采用率。Pixieset 采用逐步信任的设计,让用户逐张审核 AI 生成的描述,并利用 Bedrock 的跨区域

Microsoft Research Blog一手来源研究17

微软研究院推出 CARE-X:面向临床胸部 X 光解读的统一视觉语言模型

微软研究院发布了 CARE-X,一个面向胸部 X 光片解读的统一视觉语言模型,旨在通过生成式与判别式结合、奖励对齐学习和工具增强测量来提升临床实用性。该模型在 Narayana Health 的真实印度临床数据上验证,覆盖 ICU 罕见病理和 CT 确认的增大病症。研究还探索了将 Qwen3-VL-4B-Instruct 与确定性测量工具结合,以改善依赖测量

8月11日星期二 · 7
NVIDIA Generative AI Blog一手来源产品发布29

NVIDIA 与社区推动开源模型和智能代理发展

NVIDIA 在八月庆祝本地 AI 生态,发布多款新模型和工具,包括 Cosmos 3 Edge、MiniMax-H3、Laguna S 2.1、DeepSeek-V4-Flash、Inkling-Small、Wan-Animate-2 和 LTX-2.5,并支持 Meta 的 Muse Glimmer 模型。这些模型和工具旨在推动本地 AI 和智能代理的发

arXiv cs.CV一手来源研究10

NeuroPilot:智能代理驱动的神经影像处理与质量控制流水线

NeuroPilot是一个多智能体系统,将神经影像处理、质量控制和数据管理数字化为三个LLM可调用的技能。该系统在17个队列(超过123,000名受试者)中部署,覆盖从婴儿到老年的多种MRI模态。QC代理筛选了558名生产受试者,婴儿处理流程在QC验证输入上实现了100%的完成率,并将传统2-3个月的训练和数据处理时间压缩到一周。

arXiv cs.CV一手来源研究10

PragyaDoc:低资源环境下的多语言医疗文档智能理解框架

arXiv 发布论文介绍 PragyaDoc,一个面向低资源环境的多语言医疗文档理解框架。该框架通过四层流水线(并行集成 OCR 提取、几何词汇融合、确定性领域结构化、双 LLM 医学推理与定位)解决印度 22 种官方语言导致的医疗文档可访问性障碍。其目标用户包括农村人口、ASHA 工作者和患者家属,旨在提升医疗信息的可理解性。

arXiv cs.CL一手来源研究10

DocAtlas:将长文档理解视为可变状态交互

DocAtlas 是一个将长文档理解视为可变状态交互过程的系统,通过外部环境管理文档信息的搜索、读取、存储和展示。该系统结合了自改进检索、选择性证据访问和主动工作记忆,在固定上下文预算下运行。使用 GPT-5.4 时,DocAtlas 在 MMLongBench-Doc 上达到 71.4% 的准确率,超过人类专家参考水平;用 Qwen3.5-4B VLM 进

arXiv cs.LG一手来源研究4

多模态大语言模型安全格局演变:新兴威胁与防护综述

这篇arXiv论文对多模态大语言模型(MLLMs)的安全格局进行了系统性综述,提出了基于多模态的威胁分类法,涵盖对抗攻击、数据投毒、越狱和幻觉等威胁,并分析了威胁模型的变化。文章还总结了更新的安全假设和近期安全策略进展,最后讨论了开放挑战和未来方向,以推动多模态系统更规范、可扩展的安全机制发展。

arXiv cs.CV一手来源研究10

大语言模型在结直肠息肉光学诊断中的性能评估

一项发表在 arXiv 上的研究评估了多种多模态大语言模型(MLLMs)在结直肠息肉光学诊断中的表现。研究使用 PRIME 数据集,比较了 Claude Opus 4、Gemini 2.5 Pro、GPT-o3、GPT-4o 和 GPT-5 的分类准确性。结果显示,所有模型在区分肿瘤性与非肿瘤性息肉方面 F1 分数均高于 0.9,但 Gemini 2.5 P

量子位研究5

五大高校联合发布首个机器人三视角世界模型评测榜单

北京大学、清华大学、北京航空航天大学、上海交通大学、中国科学技术大学联合发起首个机器人三视角世界模型评测榜单TriWorldBench,并公布首周结果。榜单聚焦多视角一致性与物理理解,CASIA-DRL、TONGJI Spatial Intelligence Team和Fysics AI的模型位列前三。该评测旨在推动世界模型从视觉生成向具身认知演进,并提供细

8月10日星期一 · 8
Ollama Releases一手来源模型发布12

Ollama 支持 Meta 新开源模型 Muse Glimmer,可在 Apple Silicon 本地运行

Ollama 在 v0.32.7 版本中宣布支持 Meta 最新开源模型 Muse Glimmer,这是 Meta Superintelligence Labs 发布的首个模型,为 30B 多模态模型,专为本地 agent 工作负载设计。目前该模型仅通过 Ollama 的 MLX 引擎在 Apple Silicon 上提供初始支持,NVIDIA、AMD 等平

Transformers Releases一手来源产品发布11

Transformers v5.15.0 发布:新增 Muse Glimmer 等多模型支持

Hugging Face Transformers 发布 v5.15.0 版本,新增多个模型支持,包括 Meta 的 Muse Glimmer(30B 参数多模态模型,专为智能体场景设计,Apache 2.0 许可)、IBM 的 GraniteSWA/GraniteMoeSWA、SKT 的 A.X-K1/K2 和 Cosmos3 Edge。该版本还包含多项破

arXiv cs.CV一手来源研究4

TransSLR:用于手语识别的轻量级 Transformer

arXiv 论文提出 TransSLR,一种轻量级时间 Transformer 编码器,用于手语识别,针对中非手语(CASL)等低资源语言。TransSLR 在 CASL-W60 基准上达到 80.39% 的准确率,比之前最好成绩提升 10.46%,且计算开销低,适合资源受限环境。

arXiv cs.CL一手来源研究4

从失语症命名错误谱逆向恢复大语言模型损伤参数

该研究提出从失语症图片命名错误谱中逆向恢复大型语言模型(LLaVA-Vicuna 13B)的损伤参数(层索引、修改百分比、噪声sigma),并训练多任务神经网络实现映射。结果显示修改百分比和噪声sigma可恢复,层索引仅能近似恢复,但反事实验证中恢复参数能高保真复现目标行为(81.4%),表明Transformer层存在功能冗余。在278名中风幸存者的错误谱

arXiv cs.CV一手来源研究4

InsertFuse:多类别参考引导图像插入的统一框架

arXiv 论文提出 InsertFuse,一个用于多类别参考引导图像插入的统一框架。其核心思想是将类别特定专家学习与跨类别能力整合解耦,通过插入在策略蒸馏(IOPD)将多个专家能力整合到单一学生模型中。此外,引入 Token 对齐几何条件(TAGC)和区域平衡流匹配以提升空间控制,以及参考 CFG 增强参考引导。在 AnyInsertion 基准和自建多类

Hugging Face New and Trending Models一手来源开源5

MiniMax H3 量化剪枝模型集合发布,支持消费级 GPU 本地推理

Hugging Face 社区发布了 MiniMax H3 模型的量化与剪枝版本集合,支持 INT4、INT8、NVFP4 等格式,旨在让消费级 GPU(16GB-24GB 显存)用户能在本地运行该模型。该集合包含扩散模型、文本编码器和 VAE 文件,并针对不同显卡提供了选择指南。MiniMax H3 本身是一个支持文本、图像、音频到视频生成的全模态系统,可

量子位模型发布4

Om AI联汇开源端侧原生VLX-Seek 1.5,3B模型多项评测超越英伟达

Om AI联汇完成数亿元融资,并开源全球首款端侧原生模型VLX-Seek 1.5。该模型有3B和10B两个版本,采用流式多模态架构,在无人机视角、指代表达理解等任务上超越英伟达LocateAnything等更大模型。公司旨在通过端侧原生路线,推动物理AI在机器人、无人机等场景的规模化落地。

Hugging Face New and Trending Models一手来源模型发布8

Deepwen 3.6:融合 DeepSeek 推理的 3D 生成微调模型

Deepwen 3.6 是基于 Qwen3.6-35B-A3B 的微调模型,融合了 DeepSeek-V4-Flash-0731 的推理能力,专注于 AAA 游戏开发、3D 生成和 Web 图形。该模型提供了多种 MoQ 量化版本,并附带多模态投影器。其改进包括程序化生成、硬表面建模、Blender 工作流等,且保留了 Qwen 的原始能力。

8月9日星期日 · 3
Hugging Face New and Trending Models一手来源模型发布5

MiniMax 发布全模态生成系统 H3,支持 2K 视频与原生音频

MiniMax 发布了通用全模态生成系统 MiniMax H3,支持文本、图像、视频和音频的统一理解,并能生成带原生立体声的 2K 分辨率、最长 15 秒的视频。该系统包含 H3-Context-IR、H3-Base 和 H3-Regenerate-2K 三个模块,支持多种输入模式,并提供 API 和在线应用。

雷峰网 AI科技评论商业1

摩尔线程上半年营收17.36亿元超去年全年,商业化提速

国产GPU公司摩尔线程发布2026年半年度报告,上半年营收17.36亿元,同比增长147.42%,已超2025年全年,亏损大幅收窄。公司研发投入持续增加,旗舰产品MTT S5000实现规模化量产,夸娥智算集群在多城市部署,并完成多个大模型训练项目。公司构建了云边端全场景算力布局,MUSA生态兼容CUDA,开发者超80万。

量子位产品发布2

Opus 5烧6.9亿token做游戏,GPT-5.6用5美元复刻

网友Vyom使用Opus 5模型,通过一条2000字的提示词和6.9亿token,生成了一款美式卡通风格的水上快艇竞速游戏《INK TIDE》,成本约423美元。随后,网友Anul Agarwal在Codex中利用GPT-5.6 Sol和Luna Max模型,以约5美元的成本复刻了类似游戏,但画面细节和完成度相对粗糙。两个案例展示了AI生成游戏的能力,但最终

8月8日星期六 · 6
Hugging Face New and Trending Models一手来源模型发布2

飞桨发布 PaddleOCR-VL:0.9B 超紧凑多语言文档解析模型

百度飞桨发布 PaddleOCR-VL,一个基于 ERNIE-4.5-0.3B-Paddle 的 0.9B 超紧凑视觉语言模型,专注于多语言文档解析,支持 OCR、版面分析、表格、公式和图表识别。该模型以 Apache-2.0 许可证开源,并提供英文、中文和多语言支持,新版本为 PaddleOCR-VL-1.6。

THE DECODER模型发布1

xAI 发布 Imagine Image 2.0,在 Arena 基准测试中紧随 GPT-Image-2

xAI 发布了 Imagine Image 2.0 模型,作为 Grok 平台的新“质量模式”,提供精细指令遵循、排版布局优化和跨生成一致性。该模型在 Arena 基准测试中排名第二,仅次于 OpenAI 的 GPT-Image-2。新模型包含 Magic Wand、区域分割、背景移除、多参考编辑和智能调整大小等编辑工具,并推出模板和视频预制作功能。API

SGLang Releases一手来源产品发布1

SGLang v0.5.17 发布:支持 Kimi K3 与 MiniMax-H3,多项性能优化

SGLang 发布 v0.5.17 版本,包含 582 个 PR,来自 194 位贡献者。主要亮点包括对 Kimi K3 和 MiniMax-H3 的 day-0 支持,以及新的 DCP 通信后端、DWDP 预填充策略、会话感知的 Radix Cache 等性能优化。此外,还新增了多个模型支持,并提升了引擎恢复速度和降低了主机开销。

Hugging Face New and Trending Models一手来源模型发布1

Red Hat 发布 Gemma 4 12B NVFP4 量化模型

Red Hat AI 发布了基于 Google Gemma 4 12B 指令模型的 NVFP4 量化版本,该模型权重和激活均量化为 4 位浮点格式,使用 llm-compressor 工具和 GPTQ 方法进行量化,并针对 vLLM 进行了优化。初步评估显示,该量化模型在 GSM8K 和 Wikitext 基准上接近原始 BF16 模型的性能,恢复率超过 8

Strands Agents SDK Releases一手来源产品发布1

Strands Agents SDK Python v1.51.0 发布

Strands Agents SDK 发布了 python/v1.51.0 版本,包含多项新功能、修复和性能优化。新功能包括 AgentStreamStage 类型、快照会话管理器、Gemini 工具选择支持、Claude 5 和 GPT-5.6 上下文窗口限制等。修复了中断状态保留、MCP 依赖等问题,并提升了 MCP 搜索片段并发性能。

Hugging Face New and Trending Models一手来源模型发布1

Qwen3.6-35B-A3B 无审查版 Genesis Hermes V7 GGUF 发布

LuffyTheFox 发布了基于 Qwen3.6-35B-A3B 的无审查多模态 MoE 模型 GGUF 版本,采用其自研的 Genesis 算法对张量进行噪声修复,声称能提升模型稳定性和指令遵循能力。该模型融合了 Hermes 微调数据,支持视觉和智能体功能,并提供了量化脚本和推荐配置。

8月7日星期五 · 10
llama.cpp Releases一手来源产品发布1

llama.cpp b10311 修复 Qwen3-TTS 重复文本问题

llama.cpp 发布 b10311 版本,修复了 Qwen3-TTS 生成时文本流重复输入的问题。该问题源于非流式预填充与流式覆盖层不匹配,导致模型在生成时重复读取文本。修复后,覆盖层改为与预填充匹配的单个 tts_pad 行。

雷峰网 AI科技评论商业0

张一鸣拒绝蒸馏捷径,字节豪赌10万亿参数模型

字节跳动创始人张一鸣在Seed全员会上明确拒绝通过蒸馏方式追赶前沿大模型,坚持从头训练以追求长期技术主权。尽管字节在算力、数据和资金上具备优势,其Seed 2.1 Pro在全球榜单仅列第21位,落后于其他中国模型。字节计划训练10万亿参数的超大模型,并投入超2000亿元建设算力基础设施,以规模跃迁实现技术领先。

Hugging Face New and Trending Models一手来源模型发布1

MiniMax H3 FP8 量化模型发布,支持视频音频生成

rzgar 发布了 MiniMax H3 的 FP8 量化版本,包括 MXFP8、FP16attn 和 FP8 E4M3FN 等多种变体,并提供了文件下载。该模型支持图像到视频和音频生成,量化后文件大小从 47.6GB 降至 21GB,同时保留了关键张量的原始精度以保证质量。作者还提供了 ComfyUI 文本增强节点和超分辨率模型,以改善生成效果。

arXiv cs.CV一手来源研究0

无辜画面,仇恨故事:多轮视觉故事生成中的仇恨意图评估与检测

该研究指出,前沿文生图系统(如Gemini和GPT-Image)支持多轮对话生成一致的角色和场景,使得制作仇恨性视觉故事(有序图像组)变得廉价且可扩展。作者引入了HatefulStoryPrompts数据集,包含55个仇恨故事、330个多轮配置,并评估了五个前沿模型,发现所有模型都能完成超过80%的故事,最强模型达到99.0%。现有审核系统在检测组级仇恨含义

arXiv cs.CL一手来源研究0

RIG-RoPE:关系与实例门控的旋转位置编码

该论文提出 RIG-RoPE,一种关系与实例门控的旋转位置编码机制,用于改进多模态大语言模型中的位置编码。它通过模态指示符、视觉实例标识符和持续时间坐标,解决静态多维位置分配中的跨模态空间干扰和时间步长不均问题。该方法无需新增参数,可在平铺注意力内核中实现,但尚未声称经验上的优越性。

arXiv cs.CV一手来源研究0

StyleComposer:无需训练的多参考风格组合方法

arXiv 上发表了一篇题为 StyleComposer 的论文,提出了一种无需训练的多参考风格组合方法。该方法通过将颜色、纹理和结构等风格属性分别路由到扩散模型中分离效果最好的表示,并在去噪过程中协调这些路径,从而在无需训练或反转的情况下,同时满足多个参考风格和文本提示。该方法为每个属性提供了强度滑块,比现有方法更接近联合满足三个参考和提示。

arXiv cs.LG一手来源研究0

CGTime:通过计算与语言解耦实现多变量时间序列对齐

arXiv 上发布了一篇关于多变量时间序列与语言对齐的研究论文。研究指出,传统方法依赖 LLM 描述时间序列,导致标签质量受限于模型感知能力,且多变量模式难以处理。为此,研究者提出解耦感知与描述的方法,用确定性代码计算统计量,再由 LLM 进行表达,构建了 4B 参数的 CGTime 模型。该模型在多变量理解任务上优于 GPT-4o-mini 和 GPT-5

arXiv cs.MA一手来源研究0

F²Agent:面向多模态交易的金融智能体融合范式

arXiv 论文提出 F²Agent,一种用于多模态金融交易的新型智能体范式。它通过分层专业智能体提取模态特定信号,并引入模态感知自适应融合机制和噪声鲁棒一致性正则化,以捕捉跨模态依赖并生成抗噪交易信号。在六种股票和加密货币资产上的实验表明,F²Agent 在多项交易指标上优于 16 个基线,平均年化收益率相对提升超过 20%,在 GOOG 和 TSLA 上

量子位模型发布0

阿里视频大模型Wan3.0公测:文档PPT也能变视频

阿里巴巴于8月6日公测视频生成大模型Wan 3.0,支持单次生成30秒视频,并首次支持doc、xls、ppt、pdf、md等文档格式输入,可将文档转化为视频。该模型在生成时长、全能参考、真实世界还原等方面升级,旨在从内容生成工具跃迁为生产力工具。Wan3.0已在多个平台开启公测,API价格按分辨率收费,接口近期全量开放。

另有 1 家信源报道

雷峰网 AI科技评论产品发布0

阿里视频大模型Wan3.0公测:支持文档转视频,单次生成30秒

阿里巴巴于8月6日公测视频生成大模型Wan 3.0,支持单次生成30秒视频,并首次支持doc、xls、ppt、pdf、md等文档格式输入,可生成教学课件、产品演示等内容。该模型在人物真实感、视频编辑等方面升级,API价格按分辨率不同为0.3至1.2元/秒,已在多个平台开放公测。

另有 1 家信源报道