VOL. 2026-10 · 12 STORIES · MONTHLY REVIEW

AI HOT RADAR 月报

新一期发布后,可按你的时区发送
REPORT DELIVERY

把报告送到邮箱

订阅整期 AI 行业简报,不会逐条发送动态。我们会先发送确认链接,未经确认不会投递。

  1. 1发送确认邮件链接 24 小时有效
  2. 2你点击确认防止他人冒用邮箱
  3. 3投递下一期报告含摘要、在线原文与退订链接
推送周期

按 Asia/Shanghai 当地时间 08:30 后投递已发布的下一期报告;不会补发确认前的历史期刊, 可随时从邮件退订。

本月格局

本月最清晰的一条主线是能力边界同时向两端推移:一端是规模与效率的工程…

本月最清晰的一条主线是能力边界同时向两端推移:一端是规模与效率的工程极限,Kimi K3 以 2.8 万亿参数开源、并借 TPU 巨内核与投机解码把低并发 Decode 吞吐推到 709 量级,说明超大模型的推理瓶颈正被算子级方案正面拆解;另一端是形态与部署的分散化,OpenAI 的 Dot 把智能体做成 7×24 小时常驻的云端个人代理,CrowdGPT 的 Crowd-v1 则以约 10 亿参数、随机初始化权重的方式把训练本身众包出去,两者共同指向“模型不再只是一个被调用的端点”。与此同时,1.08B 的 DiffuRefill-1B 掩码扩散模型仍在预训练中途,扩散路线在语言建模上是否形成对自回归的实质分流,目前只能视为待观察趋势而非定论。开源工具链的更新集中在适配与性能细节——llama.cpp 连续修复 BF16 卷积路径并加入行预取,Transformers 5.18.0 扩充 Nemotron、HyperCLOVAX 等模型支持,Anthropic SDK 补齐会话停止原因,这些动作本身不改变格局,但反映出生态正围绕多模态、流式与长会话场景做收敛式补课。跨条目归纳来看,本月竞争重心正从“谁的模型更强”转向“谁能让模型持续在线、被高效调度并被安全地约束”:Dot 的常驻代理、NeMo Relay 对 Agent 行为的轨迹追踪,与“前沿责任联合承诺”所代表的自我监管取向,构成同一问题的三个侧面。需要说明的是,该承诺以企业自律替代具法律约束力的联邦法规,其实际约束力尚不明确,相关判断属于趋势推测。

本月格局

7 个章节 · 12 条情报
  1. 01
    模型发布DiffuRefill-1B:1.08B 掩码扩散语言模型预训练中
    2
  2. 02
    研究进展微软研究院用机器学习预测电网空间天气风险
    1
  3. 03
    开源项目llama.cpp b11292:CPU 后端支持 mul_mat 的 BF16 src1
    4
  4. 04
    API 与平台更新Anthropic TypeScript SDK v0.130.0 发布
    1
  5. 05
    教程与实践用 NVIDIA NeMo Relay 追踪 Agent Harness 行为
    1
  6. 06
    产品发布万亿参数Kimi K3推理效率战:TPU巨内核与本土超级算子
    2
  7. 07
    政策与监管AI领袖回应特朗普新安全计划:自我监管承诺
    1
01

模型发布

MODEL RELEASE2 篇

DiffuRefill-1B:1.08B 掩码扩散语言模型预训练中

Hugging Face 上出现一个名为 DiffuRefill-1B 的 1.08B 参数掩码扩散语言模型预训练检查点,目前训练约进行到一半(约 10 万步 / 20 万步,约 460 亿有效 token)。该模型采用置信度定向重填充解码,整段序列约需 20 次并行去噪即可生成,而自回归模型每 token 需一次前向。训练通过 DiLoCo 在 3-5 台单 GPU 机器上同步进行,作者称其英语流畅但事实性仍不可靠,尚未做指令微调。

查看事件脉络阅读原文 ↗

Qwen3-4B-Base 模型卡上线 Hugging Face

Hugging Face 上出现了一个名为 ReliquaryForge/qwen3-4b-base-dapo-v4 的模型页面,内容为 Qwen3-4B-Base 的模型卡。该模型卡介绍了 Qwen3 系列在预训练语料、训练技术、三阶段预训练和超参数调优方面的改进,并给出 Qwen3-4B-Base 的 4.0B 参数、32k 上下文等规格。页面还提示需使用最新版 transformers,否则会报 KeyError: 'qwen3'。

查看事件脉络阅读原文 ↗
02

研究进展

RESEARCH1 篇

微软研究院用机器学习预测电网空间天气风险

微软研究院实习生开发了一套端到端机器学习系统,利用太阳风观测、AE/Dst指数预报、地质电导率及电网基础设施数据,为美国本土66,935个变电站生成30-60分钟前的空间天气风险预测。该系统在2020-2026年评估期内检测到近80%的重大空间天气事件,Dst预测在62.2%的高活跃时段优于Burton方程,并借助50个AI代理探索特征与模型配置。

查看事件脉络阅读原文 ↗
03

开源项目

OPEN SOURCE4 篇

llama.cpp b11292:CPU 后端支持 mul_mat 的 BF16 src1

llama.cpp 发布 b11292 版本,主要修复 CPU 后端在 mul_mat 中接受 BF16 作为 src1 的问题:此前 ggml_conv_1d_dw 在 BF16 卷积核下会构造 F32 im2col 并调用 ggml_mul_mat,导致 F32×BF16 组合被 CPU 后端拒绝并误报为所有后端不支持。该提交将 BF16 拓宽到 F32 工作缓冲区,与 Metal mat vec 内核的算法保持一致,并新增 conv_1d_dw 及 mul_mat 测试;同时 Vulkan 后端收紧校验,除非 src0 为 BF16,否则拒绝 BF16 src1。

查看事件脉络阅读原文 ↗

Transformers 5.18.0 发布:新增 Nemotron、HyperCLOVAX 等模型

Hugging Face Transformers 发布 5.18.0 版本,新增四个模型支持:NVIDIA 的 Nemotron 3 Diarization 流式说话人分离模型、NemotronH Omni 多模态推理模型、NAVER 的 HyperCLOVAX Vision V2 视觉语言模型,以及 GTE 文本表示与重排序模型。该版本还包含多项破坏性变更(如 ROCm 上 gpt-oss 的 FA3 路由调整、DETR 图像处理加速等)以及大量 bug 修复与改进。

查看事件脉络阅读原文 ↗

CrowdGPT 发布社区分布式模型 Crowd-v1

CrowdGPT 发布其首个社区分布式语言模型架构 Crowd-v1,约 10 亿参数,采用 Transformer、GQA、RoPE、SwiGLU 与权重绑定设计。该模型以随机初始化权重发布,供 CrowdGPT 客户端下载并集体训练,目前训练进度为 16 亿 token,权重文件提供 BF16 与 FP32 格式及 SHA-256 校验。

查看事件脉络阅读原文 ↗

llama.cpp 发布 b11294:新增行预取并支持 Windows

llama.cpp 发布 b11294 版本,核心变更是新增 llama_prefetch_rows 功能,用于按行预取模型数据,并支持 Windows 平台(由 @praneshgo 贡献的移植代码)。该预取仅在 lazy 模式下启用,同时避免在模型代码中直接暴露 llama-mmap,改由 llama-impl 路由。版本附带 macOS、Linux、Windows、Android 等多平台预编译二进制包。

查看事件脉络阅读原文 ↗
04

API 与平台更新

API UPDATE1 篇

Anthropic TypeScript SDK v0.130.0 发布

Anthropic 发布 TypeScript SDK v0.130.0,为 Managed Agents 会话空闲事件新增 refusal 停止原因与 stop_details,并在 Admin API 中加入 Claude Enterprise 分析、支出限额、RBAC 组与角色、按用户用量与成本报告,以及 Plugins 和 Plugin Marketplaces。同时 Organization API 端点转为正式可用(GA),MCP tunnels beta 增加只读 transport 对象并在创建响应中返回一次性 relay token。此外修复了分页、tool-runner 与 memory store 字段等若干问题。

查看事件脉络阅读原文 ↗
05

教程与实践

TUTORIAL1 篇

用 NVIDIA NeMo Relay 追踪 Agent Harness 行为

NVIDIA 发布技术博客教程,介绍如何用 NVIDIA NeMo Relay 追踪 Hermes Agent 的行为。教程通过两个示例任务,展示如何利用 ATOF、ATIF 和 OpenTelemetry 三种格式的轨迹数据,检查模型与工具调用、错误、重试、耗时和 token 使用,并结合任务验证结果评估 agent harness 的改动。NeMo Relay 为 agent 可观测性和安全治理提供结构化证据层。

查看事件脉络阅读原文 ↗
06

产品发布

PRODUCT RELEASE2 篇

万亿参数Kimi K3推理效率战:TPU巨内核与本土超级算子

面对2.8万亿参数开源模型Kimi K3的推理难题,海外TPU优化团队Inferact开源tpu-megakernels,用16颗谷歌TPU v7把整个K3装进一个kernel,配合DSpark投机解码,低并发Decode吞吐达709 tokens/s;浪潮信息发布元脑SD200 Ultra超节点AI服务器,紧耦合128芯本土AI芯片,单机承载K3,Token生成时延首破5.85毫秒。两者共同指向打破算子边界、极致融合推理计算过程的技术思路,并引入AI智能体自动生成超级算子,标志大模型推理竞争从算法层深入到系统软件、芯片互联与内存管理。

查看事件脉络阅读原文 ↗

OpenAI发布全天候个人智能体Dot,10个案例实测

OpenAI发布全天候个人智能体Dot,拥有独立云端电脑并7×24小时运行,可与ChatGPT联通,对标Muse和Grok Bot。海外博主Peter Yang通过10个内测案例展示Dot能主动审计账目发现1万美元差额、调度其他ChatGPT线程完成任务、半小时分析1800多条评论,并自主提出99美元产品创意。但Dot也存在任务失败不主动汇报、ChatGPT界面日益复杂等问题,其定位更偏向工作场景的'工作中枢'。

查看事件脉络阅读原文 ↗
07

政策与监管

POLICY1 篇

AI领袖回应特朗普新安全计划:自我监管承诺

特朗普总统与谷歌、Anthropic、Meta、OpenAI、xAI、英伟达等科技公司领导人会面后,宣布了一项名为“前沿责任联合承诺”的AI安全计划。该承诺要求企业以“道德约束”方式自我监管AI技术,而非通过具有法律约束力的联邦法规。六位签署者(Sundar Pichai、Dario Amodei、Mark Zuckerberg、Greg Brockman、Elon Musk、Jensen Huang)均公开表态支持,称此举有助于安全推进AI、创造就业并增强公众信心。特朗普还表示美国公司正在“主导中国”,因此无需过多政府监管。

查看事件脉络阅读原文 ↗
12独立事件
9一手报道
8发布来源
≈10 min读完本期
回看能力边界、竞争方向与行业结构变化所有事实条目均可回到原始发布方核验
已发布总述由 deepseek-v4-flash 生成;条目来自已保存的精选与 Story,事实以原文为准。生成于 2026/10/1 02:33:41 · report-v3