VOL. 2026-09-16 · 12 STORIES · DAILY INTELLIGENCE
AI HOT RADAR 日报
2026-09-16 · PUBLISHED · 约 9 分钟
2026-09-16 共精选 12 条内容,覆盖 4 个类别
2026-09-16 共精选 12 条内容,覆盖 4 个类别。
今日看点
4 个章节 · 12 条情报- 01模型发布ZGCM-1:面向数学与智能体搜索的全开源高效基础模型6
- 02研究进展后训练量化在文本嵌入模型上的失效边界:四类嵌入器家族的实测图谱3
- 03安全llama.cpp b11000 修复 RPC 释放后使用漏洞1
- 04开源项目MinerU 4.0.0 发布:分档解析与本地文档库重构2
模型发布
MODEL RELEASE6 篇ZGCM-1:面向数学与智能体搜索的全开源高效基础模型
中关村学院与中关村人工智能研究院发布 ZGCM-1,一个完全开源的 7B 稠密基础模型,面向数学推理与智能体搜索,从零训练并开源权重、数据、代码与日志。该模型采用混合注意力、FP8 Muon 优化器和 MDP 中期训练等高效方案,在 16K 预训练上实现 4.2 倍时间到损失加速。评测显示其在 7B 规模推理基准上领先,并在部分数学与智能体搜索任务上接近参数量大得多的前沿模型。
Google DeepMind 发布 Gemini 3.8 Live 系列语音模型
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款面向近实时语音交互的新模型。前者主打规模化与成本效率,支持近实时视觉输入、97 种语言自动切换及后台工具调用;后者面向高复杂度任务,可边推理边说话,在 Artificial Analysis 语音到语音质量指数上以 82.6 分位列第一,并在 τ-Voice 等智能体任务基准上领先。两款模型即日起通过 Gemini API、Google AI Studio 等渠道向开发者、企业和普通用户逐步开放,所有生成音频均嵌入 SynthID 水印。
TAARDIS-27B 全三值量化模型发布:1.75bit 仅 5.9GB
开发者 CodeMasterCody3D 在 Hugging Face 发布 TAARDIS-27B 全三值量化模型,基于 Qwen3.8-27B,将全部权重(含 LM head 与 embedding)压至 1.75 bit/权重、5.90 GB,并附带 496 个跨层低秩三值修正分支 The Doctors,使 Wikitext 困惑度从 13.61 降至 11.83。该模型需使用作者自建的 llama.cpp 分支运行,原版会输出乱码;作者称其单人 51 天完成,转换配方开源,体积小于 PrismML 的 Ternary-Bonsai-27B,但质量仍略低。
黄仁勋亮相Dreamforce,Salesforce发布基于Nemotron的CRM推理模型Koa
在Salesforce Dreamforce大会上,NVIDIA创始人兼CEO黄仁勋与Salesforce CEO Marc Benioff同台,宣布Salesforce首个CRM推理模型Koa,该模型基于NVIDIA Nemotron 3 Super后训练而成。Koa完全在Salesforce自有基础设施上运行,训练和推理均未使用客户数据,已在Salesforce内部及Slack员工代理中运行,10月进入客户试点,预计2026年冬季在美国区域全面可用。黄仁勋还谈及AI安全是工程问题,并称每家企业都将成为AI企业。
Krea2-Turbo 4步蒸馏LoRA发布:速度提升1.6倍
开发者 lvladikov 在 Hugging Face 发布 Krea2-Turbo-Distill-4step-LoRA,这是一个基于 krea/Krea-2-Turbo 的蒸馏 LoRA 适配器,将文生图模型的最低可用步数从 8 步降至 4 步,端到端速度约提升 1.6 倍。该 LoRA 在单张 RTX 3090 上训练 21 天,使用 78,000 个训练样本,声称在 4 步下恢复了 Turbo 丢失的细节纹理,并支持 diffusers 与 ComfyUI 直接加载。
IBM 发布 Granite Time Series PatchTST-FM-r2 模型
IBM 发布 Granite Time Series PatchTST-FM-r2 时间序列基础模型,采用约 3.85 亿参数、Conformer 架构,支持零样本预测、概率预测和缺失值填补。截至 2026 年 9 月 8 日,该模型在 GIFT-Eval 基准的可复现零样本模型中排名第二,并且是同类中唯一采用 Apache 2.0 与 OpenMDW 1.0 宽松商业友好许可的领先模型。模型权重、架构、推理流程和复现基准的代码均已开放。
研究进展
RESEARCH3 篇后训练量化在文本嵌入模型上的失效边界:四类嵌入器家族的实测图谱
该研究系统测试了仅权重量化(PTQ)在检索嵌入模型上的表现,覆盖四个架构家族的五个检查点,在多种位宽和分组大小下评估三个检索语料库。结果显示,INT4/g16 下模块级量化影响极小(最多约1个NDCG点),INT3 下模块敏感度排序因模型家族而异且成本不可加,INT2 下检索质量保留率从1.3%到65.9%不等,存在强烈的模型家族依赖的“低比特悬崖”。权重重建误差在均匀量化下能较好预测检索损失,但在模块级和跨家族场景下预测能力弱,且嵌入表从未成为主导的隔离保护优先级。
智能体式RAG中部分答案质量与效用的预测
该论文提出一种轨迹内探测框架,用于研究智能体式RAG(Agentic RAG)多跳问答中中间答案状态的变化。作者在每次检索-推理迭代后强制模型生成中间答案,定义“部分答案质量”和“部分效用”两个指标,并发现多数轨迹中仅一次迭代显著提升答案质量,后续迭代收益甚微。基于此,作者构建了部分答案质量预测与部分效用预测任务,实验显示质量预测更可预测(Pearson相关系数高于0.43),并利用预测结果进行早停,可将平均迭代次数减少约11%,同时保留约98%的最终答案质量。
Google 提出 Retrieve-for-Train:用离线 RL 加速复杂 AI 搜索
Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,通过离线强化学习将奖励对齐的查询扇出行为编译为监督信号,再蒸馏进轻量扩散检索器,从而在推理时单次生成连贯、专家级的搜索结果集合。该方法在 Gemma3-4B 和 Qwen3-4B 上使用 Soft-GRPO 训练,并在时尚文本到图像与音乐文本到音乐两个集合级检索任务上超越传统方法,避免推理时大量思考预算开销。
安全
SECURITY1 篇llama.cpp b11000 修复 RPC 释放后使用漏洞
llama.cpp 发布 b11000 版本,修复了 RPC 后端中的一个严重安全漏洞(#24292)。该漏洞源于服务器按设备缓存最近的计算图,而缓存节点持有指向后端缓冲区的直接指针;当缓冲区通过 FREE_BUFFER 释放后,下一次 GRAPH_RECOMPUTE 会通过悬空指针重新执行缓存图,形成释放后使用(use-after-free)。该漏洞可被未认证的远程客户端触发,攻击者可通过后续的 ALLOC_BUFFER/SET_TENSOR 命令重塑内存块,进而泄露 libc 地址并劫持 BUFFER_CLEAR 使用的缓冲区接口 vtable,最终实现远程代码执行。修复方式是在 free_buffer() 中丢弃所有缓存图,使 graph_recompute() 的现有空值检查拒绝请求并回退到 GRAPH_COMPUTE,且不涉及协议或 API 变更。
开源项目
OPEN SOURCE2 篇MinerU 4.0.0 发布:分档解析与本地文档库重构
MinerU 发布 4.0.0 大版本,围绕分档解析质量、原生多格式文档解析、面向 Agent 阅读的本地文档库以及统一 SDK/API/服务工具进行重构。新版本用 flash/basic/standard/advanced 四档质量取代原有 pipeline/vlm/hybrid 后端选择,并支持 PDF、Office、EPUB、HTML 等原生多格式解析。同时引入 mineru 命令族、本地文档库、稳定定位符与 V1 HTTP API,默认本地解析以保护隐私,并带来多项破坏性变更与迁移要求。
llama.cpp 修复 Metal mul_mm_id 激活超 f16 范围导致的 NaN
llama.cpp 修复了 Metal 后端 mul_mm_id 算子在激活值超出 f16 范围(65504)时产生 NaN 的问题。原因是 simdgroup MMA 将 src1 窄化为 half 导致 inf 并污染整个 8x8 累加器,修复方式是按 2 的幂对 src1 重新缩放并在存储时还原,保证结果精确且对现有模型比特级一致。该缺陷曾导致 Mistral Small 4 在 Metal 上 prefill 超过 32 token 时输出全 NaN,修复后已恢复正常,性能开销约 1.14% 中位数。