返回主题地图

多模态

技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 774 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月24日周四 · 7 条
正文结构化主题已通过公开置信门槛
The Verge AI产品发布2

Meta 强化 Muse 智能体,新增视频通话与邮箱功能

Meta 宣布为其新推出的 Muse AI 智能体进行多项更新:Muse 将获得专属电子邮件地址用于执行任务,用户也可通过该邮箱与智能体沟通;新上线的 Muse Mac 应用将获得操作电脑的能力。Meta 还将为 Muse 增加视频通话功能,用户可与 Muse 虚拟形象进行实时视频对话,并可调整其声音,新的 Muse Realtime Avatar 模型将驱

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源模型发布3

NVIDIA 发布 NV-Reason-CT:面向放射科思维链的 3D CT 视觉语言模型

NVIDIA 发布 NV-Reason-CT,一个专为 3D CT 分析构建的视觉语言模型,将思维链推理扩展到全容积 CT,可生成结构化诊断报告、模拟放射科医生思维链并支持多轮追问对话。该模型基于 NV-Reason-CXR 的推理方法,采用 3D ViT 编码器与 Qwen3.5-4B 语言模型组合,处理 192³ 体素 CT 数据。NVIDIA 强调其定

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源1

llama.cpp v0.5.0 发布:后端性能提升与多模型支持

llama.cpp 发布 v0.5.0,重点提升后端性能与正确性、扩展模型覆盖并增强服务端/路由稳定性。新增 HRM-Text(DFM Mimir 1B)、MiMo-V2.6 与 HunyuanOCR 转换支持,升级 ggml 0.25.0,并加入多地址 HTTP 绑定、函数调用图像输出及多项聊天解析器/UI 修复。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源产品发布2

Optimum-Intel v2.2.0 与 OpenVINO GenAI 2026.4.0 更新

Hugging Face 博客发布 Optimum-Intel v2.2.0 与 OpenVINO GenAI 2026.4.0 更新。Optimum Intel 2.2 扩展了模型导出支持,新增 Mistral 3、DeepSeek-OCR-2、Gemma 4、Qwen-Image、LTX-2、Fun-ASR 等模型,并支持 DFlash 与 MTP 投机

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布2

AWS 推出基于智能体的对话式视频情报方案

AWS 博客介绍了一种基于智能体架构的对话式视频情报方案,用户可用自然语言对上传视频提问并在数秒内获得答案。该方案使用 Strands Agents SDK 构建单一 AI 智能体,在运行时根据问题动态编排 Amazon Bedrock、Amazon Rekognition 和 Amazon Transcribe,而非为每种问题预建固定流水线。一家大型媒体娱

正文结构化主题已通过公开置信门槛
THE DECODER产品发布1

ChatGPT Voice 升级:接入邮件日历 Slack,迈向“Her”式助手

OpenAI 为 ChatGPT Voice 推出重大升级,该功能现基于新的 GPT-6 Astra、Sol 和 Luna 模型运行,并首次可接入邮件、日历和 Slack 等插件。用户可通过语音直接完成查询日历、发送邮件、发现并取消财务应用中的重复扣款,甚至搭建带结账页面的网站等任务。语音功能也进入网页和移动端的 ChatGPT Work,支持通过对话创建文

正文结构化主题已通过公开置信门槛
THE DECODER产品发布1

YouTube 为 Creator Studio 添加脚本辅导、智能缩略图和 Gemini 编辑等 AI 工具

YouTube 在 Creator Studio 中推出一系列 AI 工具,包括分析脚本和粗剪并给出节奏、结构与叙事建议的故事助手,支持最多三个剪辑版本的 A/B 测试,以及自动为不同观众展示最合适预览图的动态缩略图。Gemini 作为聊天式编辑助手接入 Shorts 和 YouTube Create 应用,可重排画面、裁剪片段并同步音乐。此外,YouTub

另有 1 家信源报道

9月23日周三 · 13 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源API 更新1

llama.cpp b11136:llama-server 支持 OpenAI video url 视频输入

llama.cpp 发布 b11136 版本,其 llama-server 现在接受 OpenAI 兼容的 video url 内容类型,并支持 data:video/ 的 base64 URI。此前服务端只接受非标准的 input video 类型且拒绝视频 data URI,导致符合 OpenAI 规范的客户端报错。该改动使 llama-server 能

正文结构化主题已通过公开置信门槛
Latent Space观点

生物安全是AI军备竞赛:Radical Numerics CEO谈基因组语言模型

Radical Numerics 联合创始人兼 CEO Eric Nguyen 在 Latent Space 播客中讨论了生物安全作为 AI 军备竞赛的问题。他指出,Anthropic 的过滤器将网络安全和生物学列为两大风险领域,而能够提升生物能力的模型同样可以帮助防御方跟上步伐。Eric 曾在斯坦福参与开发 Evo 和 Evo 2 基因组语言模型,这些模型

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布2

LiconStudio 发布 LTX-2.5 多主体参考 LoRA

LiconStudio 在 Hugging Face 发布 Licon MSR V1,这是一个为 Lightricks 的 LTX-2.5 视频生成模型训练的多参考 LoRA。它采用 Multiple Subject Reference(MSR)方法,将最多五张参考图编码为与目标视频同一潜空间的视觉 token,并通过学习到的 slot embedding

正文结构化主题已通过公开置信门槛
量子位模型发布1

斑马智能发布端侧大模型AutoOmni 2.0

斑马智能在云栖大会发布新一代全模态端侧大模型AutoOmni 2.0-23B-A3B,采用MoE架构,普通任务能力堪比10倍参数量云模型,复杂任务达其80%-90%。同时亮相AutoClaw 2.0智舱协作服务实车方案,并宣布与YoooClaw合作打通车内车外上下文数据。该模型已合作10家芯片企业,推理加速5-6倍,量化保真度超99%。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源1

Qwen-Image-2.1 文本编码器 Heretic 量化版发布 GGUF/FP8/bf16

Hugging Face 用户 pottokao 发布了 Qwen-Image-2.1 文本编码器(Heretic)的量化版本,提供 GGUF(Q4 K M)、FP8 和 bf16 三种格式,并附带 mmproj 文件以支持 Qwen3-VL 视觉塔。作者指出此前 GGUF 报错源于 ComfyUI-GGUF 未加载视觉塔,并提供了配套补丁节点 ComfyU

正文结构化主题已通过公开置信门槛
量子位模型发布1

爱诗科技发布实时世界模型PixVerse R2

爱诗科技发布新一代实时世界模型PixVerse R2,将LLM式的Scaling逻辑引入实时世界模型,通过统一可扩展的因果建模框架把视觉、动作、音频、时序及控制信号纳入同一表示体系,并采用Omni Causal AR与Real-Time Acceleration两层架构分别负责能力上限与实时性。文章称R2在实时性、长程一致性、多模态控制等方面较R1提升,可应

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
量子位产品发布

GPT-6 Astra 搓3D刷屏后,3D生成竞争转向 Agent-Ready

量子位报道称,GPT-6 Astra 通过写代码、调用 Blender 等方式完成 3D 建模并刷屏,引发行业对通用大模型与专业 3D 生成模型关系的讨论。文章认为通用模型负责理解目标与拆解任务,专业 3D 模型负责复杂曲面与材质生成,3D 生成正从服务人类创作者的 Production-Ready 转向服务 Agent 的 Agent-Ready。影眸 H

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究1

自监督预训练提升多模态卒中复发预测的跨模态学习

该研究探讨了自监督图像预训练与选择性参数冻结策略对多模态卒中复发预测的影响。研究基于491名患者的3D CTA影像与临床表格数据,预训练并微调了ResNet和ViT两种多模态网络,并与先前基线及从头训练模型对比。结果显示自监督预训练能更有效利用多模态数据,最佳ViT模型克服了单模态崩溃,且视觉与性别、CHD之间存在显著跨模态交互。代码已公开。

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究1

LEDFlow:熵引导生成顺序的均匀离散流采样器

该论文提出 LEDFlow,一种无需训练的采样器,通过熵引导的吸收策略为均匀离散流引入生成顺序。研究发现均匀离散流中 9.4% 的生成单元在中间步骤正确但最终输出错误,LEDFlow 将这一比例降至 2.6%。在 Nikoli 数独上达到 0.845 的求解准确率,在文本到图像生成和多模态理解任务上也优于原生采样器,且推理成本相当。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究1

RULER:面向 SVG 生成的实例感知评分标准奖励

该论文提出 RULER 方法,用于从自然语言指令生成 SVG 代码的强化学习。作者发现用多轴评分标准(rubric)提示视觉语言模型评判,比 CLIP、Aesthetic 等标量指标更符合人类判断,且能避免奖励黑客问题。RULER 将每条指令转化为包含语义、视觉、风格六个条目的实例感知评分标准,由评判 VLM 逐项打分并加权作为奖励,通过 GRPO 优化,无

正文结构化主题已通过公开置信门槛
NVIDIA Generative AI Blog一手来源商业1

NVIDIA 新加坡 AI Day 展示东南亚 AI 进展

NVIDIA 在新加坡举办 AI Day,联合东南亚合作伙伴展示多项 AI 进展。新加坡 HTX 使用 Nemotron 3 Super 和 Nemotron 3 Nano Omni 模型推进公共安全 AI;NCS、ST Engineering 等企业采用 Nemotron 模型和 NeMo 工具开发智能体 AI 方案。马来西亚、越南、泰国、文莱等国的机构也

正文结构化主题已通过公开置信门槛
Ollama Releases一手来源产品发布1

Ollama 发布 v0.34.4:修复模型未找到错误并优化结构化输出

Ollama 发布 v0.34.4 版本,修复了服务端间歇性出现的“model not found”错误,并针对思考模型优化了结构化输出的单次处理流程。此外,该版本更新了 llama.cpp 与 MLX 依赖,改进了 MLX 下 Gemma 4 图像分辨率动态选择及 Qwen 3.8 提示处理速度,同时调整了应用端对 ChatGPT/Codex 的检测方式。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论观点

LeCun ECCV 2026 演讲:预测像素是伪命题,押注 JEPA 世界模型

图灵奖得主 Yann LeCun 在 ECCV 2026 发表 Keynote 演讲,主张仅靠语言和 token 训练无法让 AI 达到人类水平智能,也无法跨越物理世界门槛。他批评当前视频生成路线「预测像素」是伪命题,力推 JEPA 联合嵌入预测架构,在抽象表征空间预测未来并规划动作。LeCun 还透露约一个月前创立了 Advanced Machine In