VOL. 2026-10-04 · 12 STORIES · DAILY INTELLIGENCE

AI HOT RADAR 日报

新一期发布后,可按你的时区发送
REPORT DELIVERY

把报告送到邮箱

订阅整期 AI 行业简报,不会逐条发送动态。我们会先发送确认链接,未经确认不会投递。

  1. 1发送确认邮件链接 24 小时有效
  2. 2你点击确认防止他人冒用邮箱
  3. 3投递下一期报告含摘要、在线原文与退订链接
推送周期

按 Asia/Shanghai 当地时间 08:30 后投递已发布的下一期报告;不会补发确认前的历史期刊, 可随时从邮件退订。

今日看点

当天最突出的变化是开源模型密集发布:AutoTrust 的 JEV-…

当天最突出的变化是开源模型密集发布:AutoTrust 的 JEV-27B 以 Apache-2.0 开源并在六个公开决策基准上平均得分 84.07,略超闭源 Jev 1.13;同时 Hugging Face 上出现 1.08B 的掩码扩散语言模型 DiffuRefill-1B 预训练检查点,以及面向 ComfyUI 的三值化 Qwen 模型 Mitsuba & HiMitsuba 27B GGUF。次要趋势集中在工具链与安全治理:llama.cpp 连续发布多个版本,新增基于激活值的 imatrix 统计并修复 CUDA MMQ 内存错误等问题,LiteLLM 与 Claude Code 也分别推进镜像签名验证和插件权限修复。此外,NASA 与 IBM 联合发布基于 17 年轨道数据的开源月球基础模型,Google 提出 RRSI 方法防止自我改进 agent 过拟合测试任务,而 OpenAI 安全员工 David Robinson 的辞职则引发对公司文化的质疑。

今日看点

5 个章节 · 12 条情报
  1. 01
    模型发布DiffuRefill-1B:1.08B 掩码扩散语言模型预训练中
    5
  2. 02
    开源项目llama.cpp b11388:imatrix 支持基于激活的统计计算
    4
  3. 03
    产品发布Claude Code 2.1.289 修复插件与权限规则问题
    1
  4. 04
    研究进展Google 研究新方法防止自我改进 AI agent 死记测试任务
    1
  5. 05
    观点OpenAI安全员工辞职,称公司文化已崩坏
    1
01

模型发布

MODEL RELEASE5 篇

DiffuRefill-1B:1.08B 掩码扩散语言模型预训练中

Hugging Face 上出现一个名为 DiffuRefill-1B 的 1.08B 参数掩码扩散语言模型预训练检查点,目前训练约进行到一半(约 10 万步 / 20 万步,约 460 亿有效 token)。该模型采用置信度定向重填充解码,整段序列约需 20 次并行去噪即可生成,而自回归模型每 token 需一次前向。训练通过 DiLoCo 在 3-5 台单 GPU 机器上同步进行,作者称其英语流畅但事实性仍不可靠,尚未做指令微调。

查看事件脉络阅读原文 ↗

AutoTrust 发布开源决策模型 JEV-27B,性能略超闭源 Jev 1.13

AutoTrust AI 发布开源权重模型 autotrust/JEV-27B(Apache-2.0),在六个公开决策基准上平均得分 84.07,比闭源托管模型 TypeSafe Jev 1.13 高 0.22 个百分点。该模型采用「专家块」方案,将 Qwen3.8-27B 主干冻结,仅训练 1.089 亿参数的 System 1 决策块,同时保留原模型的生成与推理能力(HumanEval 78.0% 不变)。模型可在单张 H100 上以 bf16 全精度运行,每秒约 100 次决策,训练成本约 9.2 个 B200 小时。

查看事件脉络阅读原文 ↗

Mitsuba & HiMitsuba 27B GGUF:面向 ComfyUI 的三值化 Qwen 模型

开发者 isichan-ai 在 Hugging Face 发布了 Mitsuba & HiMitsuba 27B GGUF,这是基于 Qwen3.8-27B 自研三值化(1.58-bit)的模型,专为 ComfyUI 的图像/视频提示词生成与图像描述调优,明确不适合编程。模型以 PQ2_0(7.3GB)和 PTQ1_0(6.0GB)两种 GGUF 格式提供,可在单张 16GB GPU 上运行。作者还新增了 70MB 的 HiMitsuba 无审查 LoRA(仅适配 PQ2_0),使模型能回应原本会拒绝的成人/敏感请求。评测显示三值化牺牲了编程(66→4)和长文阅读(76→48)能力,但保留了视觉、规则遵循和日语提示词能力。

查看事件脉络阅读原文 ↗

Qwen3-4B-Base 模型卡上线 Hugging Face

Hugging Face 上出现了一个名为 ReliquaryForge/qwen3-4b-base-dapo-v4 的模型页面,内容为 Qwen3-4B-Base 的模型卡。该模型卡介绍了 Qwen3 系列在预训练语料、训练技术、三阶段预训练和超参数调优方面的改进,并给出 Qwen3-4B-Base 的 4.0B 参数、32k 上下文等规格。页面还提示需使用最新版 transformers,否则会报 KeyError: 'qwen3'。

查看事件脉络阅读原文 ↗

NASA与IBM发布开源月球基础模型,基于17年轨道数据

NASA 与 IBM Research 联合多家学术机构发布了 NASA-IBM Lunar Foundation Model,称其为首批面向月球科学的开源基础模型之一。该模型基于 TerraMind 架构从零训练,使用包含近 200 万个瓦片、11 种模态的 SomBench 数据集,数据主要来自月球勘测轨道飞行器 17 年的观测。在极地冰沉积预测任务上,模型相比最佳基线 SwinV2-B 将误差降低最多 22%,粗尺度陨石坑检测提升近 19%。模型已在 Hugging Face 和 GitHub 公开,并集成到 TerraTorch 工具包中。

查看事件脉络阅读原文 ↗
02

开源项目

OPEN SOURCE4 篇

llama.cpp b11388:imatrix 支持基于激活的统计计算

llama.cpp 发布 b11388 版本,核心变更是为 GGUF 新格式 imatrix 引入基于激活值的统计计算(PR #14891)。新增 --activation-statistics 参数,支持计算激活熵、余弦相似度、L2 范数及欧氏-余弦分数(ECS),并更新了聚合统计报告布局。同时该版本提供覆盖 macOS、Linux、Windows、Android 的多后端预编译二进制包。

查看事件脉络阅读原文 ↗

llama.cpp b11390:修复 CUDA MMQ 内存错误

llama.cpp 发布 b11390 版本,主要修复了 CUDA 后端在 n_expert 远大于 n_ubatch 时 MMQ(矩阵乘法量化)出现的内存错误。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。

查看事件脉络阅读原文 ↗
03

产品发布

PRODUCT RELEASE1 篇

Claude Code 2.1.289 修复插件与权限规则问题

Claude Code 发布 2.1.289 版本更新日志,集中修复了插件与 mod 系统的大量问题,包括权限规则在嵌套复合命令、符号链接和沙箱自动放行场景下失效,以及插件面板渲染、热重载、升级后加载失败等缺陷。同时新增 agent.spawn 用于队友协作,并统一插件 hook 事件中的 agent id,改进 agent 空闲与等待状态查询。此次更新主要提升托管环境下权限控制可靠性与插件生态稳定性。

查看事件脉络阅读原文 ↗
04

研究进展

RESEARCH1 篇

Google 研究新方法防止自我改进 AI agent 死记测试任务

Google Cloud AI Research 与多所大学提出 RRSI 方法,用于防止自我改进的 AI agent 在优化自身 harness 时过拟合测试任务。RRSI 通过逐步收紧编辑预算、引入严格 critic 过滤基准特定技巧,并只接受有性能收益的算力增加,从而提升泛化能力。在八个基准上,RRSI 训练任务最高提升 14.1 分,未见任务最高提升 4.7 分,运行时 token 减少约 30%,且性能未低于基线。

查看事件脉络阅读原文 ↗
05

观点

OPINION1 篇

OpenAI安全员工辞职,称公司文化已崩坏

OpenAI 安全员工 David Robinson 在《大西洋月刊》发文宣布辞职,称公司“文化已崩坏”。他曾负责撰写重大产品发布的安全报告,认为 OpenAI 依赖试错的“迭代部署”模式必然导致周期性失败,且随模型能力增强风险规模扩大。他援引 OpenAI 智能体入侵 Hugging Face 系统等事件,主张前沿 AI 公司应像核电站或机场一样建立冗余与审慎规划,并呼吁外部激励推动安全。OpenAI 发言人回应称公司正持续加强安全措施。

查看事件脉络阅读原文 ↗
12独立事件
9一手报道
7发布来源
≈10 min读完本期
逐条速览当天值得追踪的 AI 变化所有事实条目均可回到原始发布方核验
阅读周报 →
已发布总述由 deepseek-v4-flash 生成;条目来自已保存的精选与 Story,事实以原文为准。生成于 2026/10/4 22:13:45 · report-v3