VOL. 2026-10-05 · 12 STORIES · DAILY INTELLIGENCE

AI HOT RADAR 日报

新一期发布后,可按你的时区发送
REPORT DELIVERY

把报告送到邮箱

订阅整期 AI 行业简报,不会逐条发送动态。我们会先发送确认链接,未经确认不会投递。

  1. 1发送确认邮件链接 24 小时有效
  2. 2你点击确认防止他人冒用邮箱
  3. 3投递下一期报告含摘要、在线原文与退订链接
推送周期

按 Asia/Shanghai 当地时间 08:30 后投递已发布的下一期报告;不会补发确认前的历史期刊, 可随时从邮件退订。

今日看点

OpenAI 发布 Apache 2.0 许可的开源权重模型系列 g…

OpenAI 发布 Apache 2.0 许可的开源权重模型系列 gpt-oss,其中 gpt-oss-20b 以 21B 参数、3.6B 激活参数可在 16GB 内存运行,成为当天最受关注的模型发布。开源基础设施同步推进,Hugging Face 推出面向万亿参数 MoE 的 Olmo-core 3 训练框架,vLLM v0.31.0 与 llama.cpp 则分别针对 DeepSeek-V4.1-Flash 和 Metal 投机解码做了性能优化。研究侧聚焦模型能力边界,包括 System-1 决策模型在 Agent harness 中的配对评估、查询编码器可学习性以及 SymCE 反例生成环境揭示的模仿陷阱。产品与平台层面,Mastra 连续更新 Agent 错误恢复与工具上下文能力,Cloudflare 生日周则集中发布 46 项覆盖开源、后量子安全与智能体互联网的公告。

今日看点

4 个章节 · 12 条情报
  1. 01
    模型发布OpenAI 发布开源权重模型 gpt-oss-20b
    3
  2. 02
    研究进展System-1 决策模型在 LLM Agent Harness 中的配对与自审计评估
    3
  3. 03
    开源项目vLLM v0.31.0 发布:DeepSeek-V4.1-Flash 性能优化与快速重启
    3
  4. 04
    产品发布Mastra 1.73.0:Agent 默认错误恢复与工具暂停 UX 更新
    3
01

模型发布

MODEL RELEASE3 篇

OpenAI 发布开源权重模型 gpt-oss-20b

OpenAI 发布开源权重模型系列 gpt-oss,包含 gpt-oss-120b 和 gpt-oss-20b 两个版本,采用 Apache 2.0 许可。gpt-oss-20b 拥有 21B 参数、3.6B 激活参数,可在 16GB 内存内运行,支持可配置推理强度、完整思维链、函数调用、网页浏览和 Python 代码执行等能力。模型使用 harmony 响应格式训练,并采用原生 MXFP4 量化,可通过 Transformers、vLLM、Ollama、LM Studio 等工具部署。

查看事件脉络阅读原文 ↗

DiffuRefill-1B:1.08B 掩码扩散语言模型预训练中

Hugging Face 上出现一个名为 DiffuRefill-1B 的 1.08B 参数掩码扩散语言模型预训练检查点,目前训练约进行到一半(约 10 万步 / 20 万步,约 460 亿有效 token)。该模型采用置信度定向重填充解码,整段序列约需 20 次并行去噪即可生成,而自回归模型每 token 需一次前向。训练通过 DiLoCo 在 3-5 台单 GPU 机器上同步进行,作者称其英语流畅但事实性仍不可靠,尚未做指令微调。

查看事件脉络阅读原文 ↗

autotrust 发布 JEV-27B-VL:零样本看图决策的视觉模型

autotrust 发布 JEV-27B-VL,在 JEV-27B 基础上加入视觉能力,可同时接收图像与文本并在一次前向传播中输出每个选项的校准概率。其决策头训练时从未见过图像,却在 MicroLens 短视频封面推荐任务上达到 AUC 0.727,与基于 59,045 名用户行为训练的协同过滤(0.728)相当,且 top-5 命中率更高(59% vs 49%)。模型以 Apache-2.0 开放权重,支持 vLLM 单卡部署,并保留原文本决策能力。

查看事件脉络阅读原文 ↗
02

研究进展

RESEARCH3 篇

System-1 决策模型在 LLM Agent Harness 中的配对与自审计评估

该论文对两种 System-1 决策模型(开源 Laya 与托管 Jev)在 LLM Agent harness 的 11 个决策点上进行了配对评估,使用 18 个公开来源构建的 7,283 个基础案例和 6,640 个鲁棒性变体。结果显示 Jev 在 11 个决策点中的 9 个上显著更准确,但两者在零样本模型路由上均未超过随机水平,在 RAG 相关性门控上持平;Laya 对选项顺序敏感且在同质候选下性能骤降。作者还自我审计了评估流程,发现三处分析错误和一处设计混淆曾扭曲部署结论,例如实际节省仅 4.3% 而非报告的 23.9%。

查看事件脉络阅读原文 ↗

查询编码器学习困难:向量检索几何易但编码难

该论文研究向量检索中查询编码器的可学习性问题。作者提出基于ranking SVM的方法评估文档索引的几何容量上限,并在BRIGHT、BEIR、LIMIT等20个数据集上测试多种预训练和微调查询编码器,发现几何容量很少成为瓶颈,但查询编码器即使微调后召回率也常低于50%甚至25%。理论上,作者构造了一个检索任务,证明存在完美召回的小型ReLU网络查询编码器,但任何统计查询学习器都需要指数级查询才能超过随机基线,表明查询编码器的可学习性可能是密集检索的主要障碍。

查看事件脉络阅读原文 ↗

SymCE:逐定理符号验证器生成反例,模仿有害而强化修复

该论文提出 SymCE,一个包含 4,707 个假数学猜想及逐定理 Python 验证器的确定性反例生成环境,验证器同时充当强化学习奖励函数。作者发现仅用反例数据做 SFT 会导致「模仿陷阱」,使模型识别真定理的能力从 0.27 崩溃至 0.00,而基于验证器的 RLVR 可修复该问题并提升至 0.66。训练后的 Qwen3-4B 在域内反例任务上超越所有评测的 7B 开源数学专用模型,并与六个前沿商业 API 保持竞争力,同时可零样本迁移到 GSM8K、MATH-500 和 MMLU-college-math。

查看事件脉络阅读原文 ↗
03

开源项目

OPEN SOURCE3 篇

vLLM v0.31.0 发布:DeepSeek-V4.1-Flash 性能优化与快速重启

vLLM 发布 v0.31.0,包含来自 307 位贡献者的 717 个提交。该版本重点优化 DeepSeek-V4.1-Flash 性能(FlashMLA mega attention、NVFP4 压缩 KV 缓存、DeepGEMM 稀疏 MQA 等),新增快速重启的 vllm preload 权重缓存守护进程与 CRIU 快照,并在 Model Runner V2 上支持投机解码。同时引入大规模服务后端 MoonEP、调度控制参数及多项安全加固与破坏性变更。

查看事件脉络阅读原文 ↗

Hugging Face 发布 Olmo-core 3:面向大型 MoE 的开放可扩展训练基础设施

Hugging Face 发布 Olmo-core 3,这是其大模型训练框架的重大升级,核心是重新设计的开放 MoE 训练系统,可扩展到万亿参数规模。它从 FSDP 切换到基于 DDP 的系统,结合专家并行、流水线并行、分布式优化器以及 MXFP8 低精度格式等优化。在 8 张 NVIDIA B300 GPU 上,470 亿参数 MoE 吞吐量达每 GPU 每秒 5.2 万 token,约为旧实现的 2.7 倍;并在 512 张 GPU 上基准测试了 1.2 万亿参数模型。

查看事件脉络阅读原文 ↗

llama.cpp b11404:Metal 新增少行 MMA 矩阵乘法加速投机解码

llama.cpp 发布 b11404 版本,主要针对 Metal 后端新增少行 MMA 矩阵乘法内核,用于加速投机解码中每步少量草稿 token 的验证。此前 Metal 在无 tensor API 时使用 mat-vec 内核,耗时随 src1 行数增长,导致 M3 Ultra 上 DFlash2 解码慢于串行解码。新内核支持 2 至 16 行、多种量化类型,并加入 MUL_MAT+ADD 融合与批量拷贝等优化,仅在 MTLGPUFamilyApple7+ 且无 tensor API 的设备上按行数阈值启用。

查看事件脉络阅读原文 ↗
04

产品发布

PRODUCT RELEASE3 篇

Mastra 1.73.0:Agent 默认错误恢复与工具暂停 UX 更新

Mastra 发布 @mastra/core 1.73.0 等更新,为所有 Agent 默认启用三个错误处理器(ProviderHistoryCompat、PrefillErrorHandler、StreamErrorRetryProcessor),可在重试前修复历史与提示,并支持通过 errorProcessors 与 errorProcessorDefaults:false 自定义或关闭。新增 tool-call-resumed 流式分块以改善工具暂停/审批的 UI 状态处理,@mastra/connect 增加 Google Docs/Drive/Sheets 工具集与二进制代理响应,@mastra/memory 的 recall 工具可向模型展示附件。同时修复持久化/事件化执行的可靠性问题,并将大线程历史加载从二次复杂度优化为线性。

查看事件脉络阅读原文 ↗

Mastra 更新:工具可读完整对话,记忆召回支持分页

Mastra 发布 2026 年 10 月 1 日更新,核心包 @mastra/core 升至 1.74.0,新增 agent.getMessages() 让工具在标准与持久化 agent 循环中读取完整对话上下文;观测记忆历史支持 groupId 过滤、排序和 recordId 查询,记忆召回可围绕搜索命中分页浏览观测组。Playground UI 新增无障碍表单组件并移除部分旧 API,同时修复 Slack 重命名后 @提及失效、Factory 凭证加载等问题,并提升安全依赖版本。

查看事件脉络阅读原文 ↗

Cloudflare 2026 生日周发布 46 项公告:开源、后量子安全与智能体互联网

Cloudflare 在 2026 年生日周期间共发布 46 项公告,覆盖开源、应用安全、后量子迁移、智能体互联网经济模型、开发者平台与性能优化等方向。开源方面推出智能体 CLI「cf」、SDK/CLI 生成流水线 Forge、解决插件安全问题的无服务器 CMS EmDash,并宣布 VoidZero 的 Void 平台将完全开源。安全方面宣布计划成为公共证书颁发机构,并推进 Merkle Tree 证书等后量子认证方案,目标在 2029 年前完成后量子迁移。开发者平台新增数据分析、存储、AI 与智能体开发工具,同时用前沿 AI 模型对自家 WAF 进行红队测试并发现检测缺口。

查看事件脉络阅读原文 ↗
12独立事件
12一手报道
9发布来源
≈10 min读完本期
逐条速览当天值得追踪的 AI 变化所有事实条目均可回到原始发布方核验
阅读周报 →
已发布总述由 deepseek-v4-flash 生成;条目来自已保存的精选与 Story,事实以原文为准。生成于 2026/10/5 21:21:47 · report-v3