返回主题地图

多模态

技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 777 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月6日周四 · 12 条
正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

ToolArtist:用于智能体图像生成的工具使用统一多模态模型

ToolArtist 提出了一种完全智能体的图像生成模型,通过对统一多模态模型进行后训练,将推理、外部工具调用和原生图像生成整合到单一策略中。在监督微调阶段,教师智能体使用搜索和图像生成工具,并将轨迹转换为统一多模态模型兼容格式;在强化学习阶段,引入 Reason-Act-Draw GRPO 算法,结合意图和质量奖励进行联合优化。实验表明,将整个开放世界图像

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

蚂蚁集团IJCAI 2026论文:探索AI动态自适应能力

蚂蚁集团在IJCAI 2026上发表了四篇论文,分别涉及时间序列聚类、离线到在线强化学习、贝叶斯优化和多模态视频评估,共同探索AI在动态环境中的自适应能力。这些研究旨在解决真实世界中模型性能衰减的问题,并已在多个基准测试中取得领先结果。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

华为IJCAI 2026四篇论文:从规模密度转向设计密度

华为在IJCAI 2026上发表了四篇论文,分别涉及层次化视觉Transformer扩展到30B参数、可学习帧选择器提升视频描述、表征感知模块化框架降低跨任务适配成本,以及语码转换语音翻译的MoE架构。这些研究体现了从规模密度向设计密度的转变,强调通过架构和训练策略优化来提升效率。

正文结构化主题已通过公开置信门槛
Kimi Model Repository Activity一手来源模型发布

Moonshot AI 发布开源 2.8T 参数多模态智能体模型 Kimi K3

Moonshot AI 发布了其最强大的开源权重模型 Kimi K3,这是一个 2.8 万亿参数的原生多模态智能体模型,采用 Kimi Delta Attention 和 Attention Residuals 架构,支持 100 万 token 上下文窗口。该模型激活 1040 亿参数,在 896 个专家中激活 16 个,据称相比 Kimi K2 在扩展效

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

mmMind:姿态引导的毫米波雷达行为理解模型

arXiv 论文提出 mmMind,一种雷达-语言模型,利用同步 3D 姿态作为训练监督,使基础模型能理解毫米波雷达数据。该模型通过姿态引导预训练学习人体结构和运动,推理时仅需雷达输入,并用于行为描述和时空问答。作者还发布了包含 17.9 小时真实数据的 mmMind-Bench 基准,实验表明 mmMind 在多个任务上优于现有基线。

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

蒙特卡洛树搜索驱动的表格到多模态报告生成

本文提出MCTS-Report框架,利用蒙特卡洛树搜索将表格到多模态报告生成任务分解为章节规划、图表生成等原子动作,由LLM逐步执行。该框架通过多维奖励函数评估数值一致性、图表质量等,并构建了MMRBench基准。实验表明,MCTS-Report在结构完整性、数值准确性和图表文本对齐等方面显著优于基线,总分为77.9。

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

动态潜在推理:先感知后推理的视频理解与问答新方法

arXiv 上发布了一项关于视频问答的新研究,提出了动态潜在推理(DyLaR)方法。该方法先通过感知潜在状态定位问题相关的视觉证据,再自适应决定是否在潜在空间中进行推理,从而避免冗长的文本思维链。在九个视频基准和四个多模态语言模型上的实验显示,DyLaR 在提升准确率的同时大幅减少了生成的 token 数量,例如在 Qwen3-VL-4B 上将平均准确率从

正文结构化主题已通过公开置信门槛
正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

OncoTriad-QA:泛癌推理的放射-病理-基因组学基准

arXiv 发布了一项名为 OncoTriad-QA 的基准,用于评估医学大语言模型和视觉语言模型在泛癌推理中的能力,该基准整合了放射学、病理学、基因组学和临床元数据。研究团队还提出了参考模型 OncoVLM,在微调后其性能显著优于 MedGemma-4B,平均提升 10.7 分。该基准包含 86.1k 个问题,覆盖 32 个癌症队列的 9,281 个 TC

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10290 发布:新增 ggml build forward order 修复音频图问题

llama.cpp 发布 b10290 版本,新增 ggml build forward order 函数,用于在计算图中插入节点而不设置计算标志,以解决 mtmd 音频图中 GEN WAV 调用因陈旧输入触发断言的问题。该版本提供了多平台二进制文件,包括 macOS、Linux、Windows、Android 等。

正文结构化主题已通过公开置信门槛
OpenAI Status History一手来源产品发布

OpenAI 图像生成服务错误率升高已恢复

OpenAI 报告其图像生成服务出现错误率升高的问题,部分用户的图像生成请求失败。团队已确认问题并应用缓解措施,目前所有受影响服务已完全恢复,正在监控恢复情况。

正文结构化主题已通过公开置信门槛
Simon Willison's Weblog产品发布

用 Claude Fable 5 一次性构建浣熊抢劫游戏

Simon Willison 在 2026 年 8 月 5 日,使用 Claude Fable 5(在 Claude Code for web 中运行)根据他 2022 年的一条推文内容,一次性构建了一个完整的 3D 浏览器游戏“Raccoon Heist”。他通过 GitHub Pages 实现实时预览,并赋予 Claude 访问 OpenAI 图像生成

8月5日周三 · 4 条
正文结构化主题已通过公开置信门槛
Simon Willison's Weblog开源

MiniMax-H3 发布,MLX 移植版支持 Apple Silicon 运行

MiniMax 发布了通用全模态生成系统 MiniMax-H3,支持文本、图像、音频和视频输入,可生成最长 15 秒的带音频视频。PipeNetwork 提供了将其移植到 MLX 的 Python 包,使模型能在 Apple Silicon 上运行。作者在 M5 Max MacBook Pro 上成功运行,下载约 115GB 模型文件,生成视频耗时近 45

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10270 发布,支持 Qwen3-TTS

llama.cpp 发布 b10270 版本,主要新增对 Qwen3-TTS 的支持,包括文本模型、编码器、说话人编码器及代码到语音的转换,并重构了 llama-tts 二进制文件。该版本还提供了多种平台和硬件加速的预编译二进制文件。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.6-35B-A3B 无审查多模态模型 Genesis Hermes V6 发布

LuffyTheFox 发布了基于 Qwen3.6-35B-A3B 的无审查多模态 MoE 模型 Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V6-GGUF,该模型通过其自研的 Genesis 算法对张量进行噪声修复,无需重新训练即可提升模型稳定性和输出质量。模型融合了 Hermes 微调数据,支持多语言和视觉任务,并

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源研究

NVIDIA 提出世界动作模型,Cosmos 3 助力机器人操作泛化

NVIDIA 技术博客探讨了从视觉-语言-动作模型(VLA)向世界动作模型(WAM)的转变,指出 WAM 基于视频世界模型构建,能更好地泛化物理交互。NVIDIA 发布了 Cosmos 3 世界基础模型,并基于其训练了 DROID 机器人策略,实验显示 omni 检查点将成功率从 28.1% 提升至 36.8%。

8月4日周二 · 4 条
正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

GEOID-Flood:大规模多模态洪水分割基准数据集

GEOID-Flood是一个大规模多模态洪水分割基准数据集,基于Copernicus应急管理服务数据,覆盖65个国家219起事件,包含超过14,000个瓦片,提供配准的灾前/灾后Sentinel-1(GRD和RTC格式)、灾前Sentinel-2合成影像和DEM,并带有手动验证的标签。研究评估了基础模型与传统编码器在单图像、多时序和多模态协议下的表现,发现基

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

ICDAR 2026 竞赛:ALD/E 科学图表信息提取基准发布

ICDAR 2026 举办了一项关于原子层沉积/蚀刻(ALD/E)科学图表信息提取的竞赛,并发布了 Sci-ImageMiner 基准数据集。该竞赛吸引了 68 名参与者和 1263 次提交,结果显示多模态模型在分类和摘要任务上表现良好,但在数据提取和科学推理方面存在不足。该基准和竞赛为科学图表理解提供了评估平台。

正文结构化主题已通过公开置信门槛
Mistral AI News一手来源模型发布

Mistral AI 发布开源多模态安全分类器 Shieldstral

Mistral AI 发布了 Shieldstral,一个 3B 参数的开源多模态安全分类器,通过将内容审核构建为策略自适应问答任务,在文本安全方面匹配甚至超越高达其 7 倍规模的模型,并在多模态审核上达到新高度。该模型支持在推理时以自然语言提供政策,无需重新训练即可统一处理文本和图像,并输出校准的安全分数。Shieldstral 以 Apache 2.0

正文结构化主题已通过公开置信门槛
Microsoft AI Blog一手来源研究

微软与Paige发布病理学基础模型PRISM2

微软研究院与Paige(现为Tempus旗下)合作开发了病理学基础模型PRISM2,该模型基于组织图像和真实病理报告中的语言进行训练。在多项基准测试中,PRISM2在前列腺癌、乳腺癌和乳腺淋巴结转移检测等任务上达到或超过了专门的癌症检测系统,且无需为每个任务单独建模。PRISM2的完整模型权重已在Hugging Face上公开发布,供研究使用。