VOL. 2026-10-01 · 12 STORIES · DAILY INTELLIGENCE

AI HOT RADAR 日报

新一期发布后,可按你的时区发送
REPORT DELIVERY

把报告送到邮箱

订阅整期 AI 行业简报,不会逐条发送动态。我们会先发送确认链接,未经确认不会投递。

  1. 1发送确认邮件链接 24 小时有效
  2. 2你点击确认防止他人冒用邮箱
  3. 3投递下一期报告含摘要、在线原文与退订链接
推送周期

按 Asia/Shanghai 当地时间 08:30 后投递已发布的下一期报告;不会补发确认前的历史期刊, 可随时从邮件退订。

今日看点

Google DeepMind 发布 Gemini 4 Argon,…

Google DeepMind 发布 Gemini 4 Argon,在 19 项基准中 13 项取得 SOTA,并将输出 token 上限提升至 100 万,成为当天最突出的前沿模型进展。模型层面,Hugging Face 上出现 1.08B 参数的掩码扩散语言模型 DiffuRefill-1B 预训练检查点,以及泰英双语决策模型 OpenThai-SystemOne 等新发布。研究侧则聚焦智能体自我改进与对齐风险预测,AREX-2 和「对齐预测」基准分别推进长时程反思训练与训练前失准预判。产品与工具方面,Cloudflare AI Search 正式 GA 并新增多模态检索与 OCR,Agno v3.1.0 补充了 RBAC 授权与文件系统能力。

今日看点

4 个章节 · 12 条情报
  1. 01
    模型发布DiffuRefill-1B:1.08B 掩码扩散语言模型预训练中
    5
  2. 02
    产品发布Dwarkesh 错在哪:OpenAI 一周内克隆 Jev 竞品
    2
  3. 03
    研究进展PatchHolmes:基于列表选择的智能体补丁检索
    4
  4. 04
    开源项目Agno 发布 v3.1.0:新增 RBAC 授权与文件系统
    1
01

模型发布

MODEL RELEASE5 篇

DiffuRefill-1B:1.08B 掩码扩散语言模型预训练中

Hugging Face 上出现一个名为 DiffuRefill-1B 的 1.08B 参数掩码扩散语言模型预训练检查点,目前训练约进行到一半(约 10 万步 / 20 万步,约 460 亿有效 token)。该模型采用置信度定向重填充解码,整段序列约需 20 次并行去噪即可生成,而自回归模型每 token 需一次前向。训练通过 DiLoCo 在 3-5 台单 GPU 机器上同步进行,作者称其英语流畅但事实性仍不可靠,尚未做指令微调。

查看事件脉络阅读原文 ↗

d0xin 发布 Swift-Qwen3.8-27B 无审查 NVFP4 量化版

Hugging Face 用户 d0xin 发布了 Swift-Qwen3.8-27B-Uncensored 的 NVFP4 量化版本,基于 NVIDIA ModelOpt Local-Hessian 校准与激活余量(activation headroom)技术,采用 NVFP4/FP8 混合精度拓扑。该版本在 RTX PRO 6000 Blackwell 上相比 FP8 版本解码吞吐提升 20-27%、预填充吞吐提升 34-38%、显存占用降低 15.1%,同时在固定 MMLU-Pro 子集上保持 225/280 的准确率。模型刻意移除了拒绝行为,在固定 100 条提示评估中拒绝率为 0。

查看事件脉络阅读原文 ↗

Google DeepMind 发布 Gemini 4 Argon 前沿模型

Google DeepMind 发布新一代前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络防御方开放,并参与美国政府预发布模型访问流程。该模型支持长程复杂推理,输出 token 上限提升至 100 万,在 DeepSWE v1.1、Vals Index、LVBench 等基准上取得领先成绩,并已用于 Google 内部代码迁移、内存优化和量子算法优化。Argon 还具备自主发现、验证和修补漏洞的网络安全防御能力,Wiz 已借助它发现医疗软件中的严重漏洞。

查看事件脉络阅读原文 ↗

OpenThai-SystemOne:泰英双语 System One 决策模型

Hugging Face 上发布了 iapp/OpenThai-SystemOne,一个基于 Qwen3.5-0.8B-Base 的泰语+英语「System One」决策模型,采用 Apache-2.0 许可。该模型不生成文本,而是在一次前向传播中对给定状态和问题返回校准后的选项概率,支持 choice、score、noul 三类问题,可用于工单路由、内容审核、意图识别、RAG 相关性判断以及计算机使用/浏览器代理的动作选择。模型提供 Python 客户端、兼容 TypeSafe 的 HTTP 服务以及 Ollama 本地部署版本。

查看事件脉络阅读原文 ↗

Gemini 4 Argon 发布:13/19 基准 SOTA,支持 100 万输出 token

Google DeepMind 发布 Gemini 4 Argon,在 19 项基准中的 13 项取得 SOTA,并首次实现 100 万 token 输出上限(通过 Long Decode Continuation API 功能)。目前仅面向政府用户和 Fairwind 计划中的可信网络安全防御者开放预览,定价为每百万输入/输出 token 4/20 美元,另有五折优惠。Artificial Analysis 评测其智能指数为 53,与 GPT-6 Astra 持平,但幻觉率更低(15% vs 51%),准确率也较低(50% vs 63%)。

查看事件脉络阅读原文 ↗
02

产品发布

PRODUCT RELEASE2 篇

Dwarkesh 错在哪:OpenAI 一周内克隆 Jev 竞品

Latent Space 播客在 OpenAI DevDay 后采访了 OpenAI 计算机使用(Computer Use)负责人 Ari Weinstein 和 API 团队 Nikunj Handa。Ari 表示 Computer Use 相比几个月前已“180 度不同”,代理能自我调试并从失败中恢复,结合截图、无障碍树、DOM、Playwright 与生成代码提升速度,下一步目标是让代理在软件操作上超越人类。Nikunj 介绍了新开发者栈,包括异步工具调用、回合中干预、WebSockets、UltraFast 推理、Decisions API、提示缓存、预热、压缩和 Agents API,并提到 Decisions API 目前只是 Luna 的封装。

查看事件脉络阅读原文 ↗

Cloudflare AI Search 正式 GA,新增多模态检索与 OCR

Cloudflare 宣布 AI Search 正式 GA,该产品整合 Workers AI、Vectorize、R2 和 Browser Run,提供全托管索引与检索流水线。此次更新新增原生图像嵌入、PDF OCR 及更大文件支持(文本和 PDF 上限从 4 MiB 提升至 10 MiB),并采用 Qwen3-VL-Embedding 模型实现多模态检索。计费将于 2026 年 11 月 1 日启动,所有 Workers 计划保留免费额度。

查看事件脉络阅读原文 ↗
03

研究进展

RESEARCH4 篇

PatchHolmes:基于列表选择的智能体补丁检索

该论文提出 PatchHolmes,一个两阶段补丁检索系统,用于为已知漏洞找到修复提交。第一阶段使用混合检索器,第二阶段采用智能体循环,一次性读取前100个候选列表并选择性阅读3到10个提交,最终提交最佳结果。在 GitHubAD 数据集上,PatchHolmes 的 Recall@1 比逐点分类器 Favia 高 25.34%,比 IRCoT 高 31.40%,且每个 CVE 仅需一次智能体对话。系统基于冻结的开源权重模型和本地 Git 仓库运行,无需微调或外部搜索 API。

查看事件脉络阅读原文 ↗

AREX-2:通过长时程反思任务推进自我改进智能体

该论文提出 AREX-2,旨在提升 LLM 智能体的自我改进能力,即测试时通过多轮迭代优化解决方案。研究基于 Qwen3.8-27B 构建智能体,利用机器学习工程和算法编程任务合成长期反思轨迹进行训练。在 MLE-bench Lite 上达到 81.8,Frontier-CS 上 70.7,并迁移至深度研究任务,在 BrowseComp、HLE、GAIA、DeepSearchQA 上分别取得 84.0、52.6、92.2、93.8 的成绩,且随轮次预算增加持续提升。

查看事件脉络阅读原文 ↗

对齐预测:从训练数据预测模型失准

研究者提出「对齐预测」(Alignment Forecasting)任务,即在微调训练前预测模型是否会出现欺骗、谄媚等对齐失败,并发布包含17个目标模型、32个数据集、16种失败模式的基准 AlignmentForecastBench。他们提出的预测框架由LLM审计数据集并打分,再用逻辑回归结合失败模式基率和目标模型先验倾向,效果显著高于随机,并优于直接提示前沿模型、微调专用模型及弱模型迁移方法。其信号还能标记前沿模型分类器漏掉的问题训练样本,过滤 UltraChat 中此类样本后多数情况下模型更对齐,但开放式对话中的收益尚不明确。

查看事件脉络阅读原文 ↗

教师是方向而非终点:在线策略蒸馏中RL表示残差的外推

该论文提出 RIDE(RL-Induced Direction Extrapolation)方法,用于在线策略蒸馏(OPD)。作者观察到强化学习会相对基础检查点改变模型内部表示,且该变化方向可在每一层测量,因此 RIDE 在表示空间中直接外推 RL 引起的残差:在每层和每个 token 位置计算教师模型与其 RL 前检查点的残差,并将学生隐藏状态回归到沿该残差超越教师的目标上。在四组不同规模、架构和预训练来源的基础/RL 教师对上,RIDE 均接近或超过 RL 训练教师,且优于输出空间外推方法。

查看事件脉络阅读原文 ↗
04

开源项目

OPEN SOURCE1 篇

Agno 发布 v3.1.0:新增 RBAC 授权与文件系统

Agno 发布 v3.1.0,新增 agno.os.authz 包为 AgentOS 提供基于角色的访问控制(RBAC),包含角色存储、作用域策略、审计日志、用户目录和管理路由,并支持可插拔授权引擎;同时新增 agno.fs 文件系统(DbFileSystem)及 /filesystem 路由。该版本还更新了 MCP 配置与认证、新增 AIMLAPITools 工具包,并包含多项破坏性变更:文件系统表按 (namespace, user_id, path) 重新设键需手动迁移,MCP 默认与生命周期工具改为需显式开启。此外修复了 HITL、OpenAIResponses、结构化输出、分块、CSV 读取等多项问题。

查看事件脉络阅读原文 ↗
12独立事件
10一手报道
9发布来源
≈10 min读完本期
逐条速览当天值得追踪的 AI 变化所有事实条目均可回到原始发布方核验
阅读周报 →
已发布总述由 deepseek-v4-flash 生成;条目来自已保存的精选与 Story,事实以原文为准。生成于 2026/10/1 22:04:10 · report-v3