VOL. 2026-10-03 · 12 STORIES · DAILY INTELLIGENCE

AI HOT RADAR 日报

新一期发布后,可按你的时区发送
REPORT DELIVERY

把报告送到邮箱

订阅整期 AI 行业简报,不会逐条发送动态。我们会先发送确认链接,未经确认不会投递。

  1. 1发送确认邮件链接 24 小时有效
  2. 2你点击确认防止他人冒用邮箱
  3. 3投递下一期报告含摘要、在线原文与退订链接
推送周期

按 Asia/Shanghai 当地时间 08:30 后投递已发布的下一期报告;不会补发确认前的历史期刊, 可随时从邮件退订。

今日看点

当天最值得注意的变化是决策模型开始成体系落地:Cloudflare …

当天最值得注意的变化是决策模型开始成体系落地:Cloudflare 发布 Clef 与 Clef-flash,llama.cpp 也新增 /v1/systemone 端点支持这类不生成文本、只对选项打分并返回概率的模型,指向请求路由、内容审核与 Agent 步骤校验等场景。模型侧同时出现多项新发布,包括 1.08B 的掩码扩散语言模型 DiffuRefill-1B 预训练检查点、Boson AI 的 Higgs Audio V2 音频分词器,以及 GLM-5.3-Flash-Uncensored 的 imatrix GGUF 量化版本。工具链方面,llama.cpp 连续发布多个版本,重点在 MoE 性能、lightning indexer 内存优化与图调度修复,MCP 的 TypeScript 与 Python SDK 同步升至 2.3.0,均以行为约束和兼容性调整为主。Claude Code 与 PydanticAI 也发布了包含新 API 与兼容性修复的更新。

今日看点

4 个章节 · 12 条情报
  1. 01
    模型发布DiffuRefill-1B:1.08B 掩码扩散语言模型预训练中
    3
  2. 02
    开源项目llama.cpp b11374:ggml-openvino 更新至 2026.4.1 并优化 MoE 性能
    6
  3. 03
    产品发布llama.cpp 新增决策模型与 /v1/systemone 端点
    2
  4. 04
    API 与平台更新MCP TypeScript SDK 发布 2.3.0 版本
    1
01

模型发布

MODEL RELEASE3 篇

DiffuRefill-1B:1.08B 掩码扩散语言模型预训练中

Hugging Face 上出现一个名为 DiffuRefill-1B 的 1.08B 参数掩码扩散语言模型预训练检查点,目前训练约进行到一半(约 10 万步 / 20 万步,约 460 亿有效 token)。该模型采用置信度定向重填充解码,整段序列约需 20 次并行去噪即可生成,而自回归模型每 token 需一次前向。训练通过 DiLoCo 在 3-5 台单 GPU 机器上同步进行,作者称其英语流畅但事实性仍不可靠,尚未做指令微调。

查看事件脉络阅读原文 ↗

Boson AI 发布 Higgs Audio V2 音频分词器

Boson AI 在 Hugging Face 发布 Higgs Audio V2 Tokenizer,一种以 25 帧/秒运行、在 24 kHz 数据上统一训练语音、音乐和声音事件的离散音频分词器。该模型采用非扩散编码器/解码器实现快速批量推理,并在声学、语义和美学指标上取得均衡表现,已原生支持 transformers。

查看事件脉络阅读原文 ↗

Cloudflare 发布 Clef 决策模型,称 AI 智能体无需人类介入

Cloudflare 发布了两款面向 AI 智能体的决策模型 Clef 和 Clef-flash,直接对标 TypeSafe AI 的 Jev。这两款模型不生成文本,而是对预定义答案选项分配概率,供下游系统自动执行路由、升级或转人工等操作。Cloudflare 称 Clef-flash 中位响应时间约 39 毫秒、Clef 约 209 毫秒,均快于 Jev 的 524 毫秒,并支持文本与图像输入。模型基于 Qwen 构建,采用 RLCD 训练方法,已在 Workers AI 平台上线并以 Apache-2.0 许可在 Hugging Face 发布。

查看事件脉络阅读原文 ↗
02

开源项目

OPEN SOURCE6 篇

llama.cpp b11374:ggml-openvino 更新至 2026.4.1 并优化 MoE 性能

llama.cpp 发布 b11374 版本,主要更新 ggml-openvino 后端至 2026.4.1,优化性能、扩展算子并改进设备枚举。更新包含针对 Qwen3.5 MoE 的性能优化、MoE 路由与 GDN 归一化融合、编译模型缓存导入模式,以及为 gemma-4 融合 gate_up 权重的 MoE 专家实现。在 Arc B390 上,gemma-4-26B-A4B 的 pp512 从 66.16 t/s 提升至 1608.73 t/s,困惑度基本不变。

查看事件脉络阅读原文 ↗

GLM-5.3-Flash-Uncensored 的 imatrix GGUF 量化发布

Hugging Face 用户 BoldingBuilds 发布了 GLM-5.3-Flash-Uncensored 模型的 imatrix GGUF 量化版本,基于 OrcaRouter 的去审查 FP8 模型构建,为 320B 总参数/18B 激活的 MoE 架构,支持 1M 上下文。作者因 IQ2_S 量化版本出现循环和输出不连贯问题而重建了多个量化版本,并针对 mainline llama.cpp 的架构命名变更重新发布了分片文件。该模型移除了安全拒绝机制,仅限研究用途。

查看事件脉络阅读原文 ↗

llama.cpp b11372:优化 lightning indexer 内存与多后端支持

llama.cpp 发布 b11372 版本,主要针对 qwen4exp 的 lightning indexer 进行内存与性能优化:将索引器分数内存减半,改为逐头计算并原地累加,避免同时存在两个大型 f32 张量。同时为 CUDA 增加 4 头支持、Metal 将头数作为函数常量、Vulkan 按 keys 和 tokens 分块并向量化加载、使用 fp16 点积。这些改动降低了长上下文下的显存占用并扩展了后端支持。

查看事件脉络阅读原文 ↗

PydanticAI v2.54.0 发布:兼容性调整与新功能

PydanticAI 发布 v2.54.0,包含多项兼容性调整、新功能和错误修复。兼容性方面处理了 JSON Schema draft-7 列表形式 items、FallbackModel 下的 ImageGeneration、持久执行引擎绑定限制等。新功能包括 clai2 主题化文件差异、/update 自动安装最新构建、OpenAILiveModel 会话重连、WebSearchTool 支持 GPT-Live 等。修复涉及 shell realpath 回退、Gemini 图像生成回退、SnowflakeModel finish_reason 处理等。

查看事件脉络阅读原文 ↗

llama.cpp b11375:统一收集循环状态修复图重分配中止

llama.cpp 发布 b11375 版本,修复了图调度中循环状态收集的问题。此前 build_rs 用单独的 get_rows 收集额外状态,导致最坏情况下预留节点被设为 0 行,当 ubatch 单元不连续时会触发图重分配,在 GGML_SCHED_NO_REALLOC 下直接中止。现在改为单个 get_rows 统一收集 n_rs 状态,ubatch 状态与额外状态作为其视图,并新增自定义 getter(mamba ssm_scan)从第二个状态收集,使单序列 ubatch 不再复制状态。

查看事件脉络阅读原文 ↗

MCP Python SDK 发布 v2.3.0:多项行为变更与三个新选项

MCP Python SDK 发布 v2.3.0,以修复为主并新增三个选项。行为变更包括:要求 httpx2>=2.10.0、注册时拒绝无效 x-mcp-header 注解的工具、不再发送空的 _meta 和 params、initialize 不再发送空的 experimental、Mcp-Param-* 校验改为按名称查找工具、交互式 OAuth 登录不再计入请求超时。新增 max_sse_event_size、MCPServer(subscriptions=False)、Server(get_tool_input_schema=...) 以及 call_tool 在 HeaderMismatch 后重试一次等能力。

查看事件脉络阅读原文 ↗
03

产品发布

PRODUCT RELEASE2 篇

llama.cpp 新增决策模型与 /v1/systemone 端点

llama.cpp 新增 /v1/systemone 端点,支持决策模型(Decision Models)。这类模型不生成文本,而是对给定选项打分并返回概率,单次前向传播即可完成,适用于请求路由、内容审核、Agent 步骤校验等场景。官方同时列出 Julia-1、Laya、Kev-4B、lev、OpenJev 等开源模型,其中 OpenJev 支持图像输入,API 沿用 TypeSafe Jev 模型的 System One 格式,现有客户端只需更换 base URL。

查看事件脉络阅读原文 ↗

Claude Code 2.1.288 更新:新增选择 API 与多项修复

Claude Code 发布 2.1.288 版本更新,新增 mod 选择 API、内置 gh api、Ctrl+C 草稿恢复、MCP OAuth 重新认证提示、/code-review 的 --max-findings 参数、会话查找快捷键及屏幕阅读器模式等能力。同时修复了大量问题,涵盖 API 超时续传、长对话自动压缩、--resume 上下文丢失、结构化输出网关兼容、插件与 MCP 工具调用异常、Bedrock/Mantle 模型回退以及云会话恢复等。整体上这是一次以稳定性修复为主、辅以交互与插件生态增强的常规迭代。

查看事件脉络阅读原文 ↗
04

API 与平台更新

API UPDATE1 篇

MCP TypeScript SDK 发布 2.3.0 版本

MCP TypeScript SDK 发布 2.3.0 版本,核心、客户端、服务端等包同步升级。该版本要求每个请求使用独立的服务器实例,HTTP 客户端重定向限制在同源范围内,并新增工具输入元素数量限制和令牌受众校验选项。此外,客户端依赖 eventsource-parser 3.0.8 以上版本,大幅优化了大型 SSE 消息的接收速度与内存占用。

查看事件脉络阅读原文 ↗
12独立事件
11一手报道
8发布来源
≈10 min读完本期
逐条速览当天值得追踪的 AI 变化所有事实条目均可回到原始发布方核验
阅读周报 →
已发布总述由 deepseek-v4-flash 生成;条目来自已保存的精选与 Story,事实以原文为准。生成于 2026/10/3 21:00:19 · report-v3