VOL. 2026-09-30 · 11 STORIES · DAILY INTELLIGENCE
AI HOT RADAR 日报
2026-09-30 · PUBLISHED · 约 9 分钟
OpenAI 在 DevDay 2026 上成为当日最大焦点,一次性…
OpenAI 在 DevDay 2026 上成为当日最大焦点,一次性发布 25 项更新,核心是常驻型 Agent 产品 Dots 与 GPT-6.1 Sol 模型,并同步推出 Ultrafast 极速模式、Decisions API、Agents API 等平台能力,标志着代理产品与模型迭代同步加速。围绕代理生态,Cloudflare 推出 AI Gateway Auto Router 自动路由与 Monetization Gateway,尝试从成本优化和按次收费两端补齐基础设施。模型与开源侧,llama.cpp 新增 GLM-5.3-Flash 支持,而 Anthropic 红队指出该开源模型在漏洞利用能力上已逼近 Claude Mythos Preview,安全议题随之升温。研究方面则出现面向边缘设备的神经符号路由、病理学编码器 HERO 以及无需离线阶段的持续学习等进展,显示效率与可靠性仍是学术探索主线。
今日看点
5 个章节 · 11 条情报- 01产品发布OpenAI推出常驻Dots代理,对标Meta Muse5
- 02模型发布DiffuRefill-1B:1.08B 掩码扩散语言模型预训练中1
- 03研究进展面向资源受限边缘设备的神经符号路由可靠推理3
- 04开源项目llama.cpp b11279 新增 GLM-5.3-Flash 支持1
- 05安全Anthropic:智谱开源模型GLM-5.3漏洞利用能力逼近Claude Mythos Preview1
产品发布
PRODUCT RELEASE5 篇OpenAI推出常驻Dots代理,对标Meta Muse
OpenAI在DevDay 2026开发者大会上推出名为Dots的常驻AI代理,每个Dots拥有独立云电脑和浏览器,可自主完成研究、数据分析、编码等任务,用户可通过ChatGPT、Slack和Microsoft Teams与其交互。Dots在后台仅使用只读权限进行主动研究,敏感操作需用户批准,并配有自定义规则和活动视图等安全机制。同时OpenAI发布更便宜的GPT-6.1 Sol模型,而高端GPT-6.1 Astra因安全问题暂缓推出。欧洲Pro用户暂无法使用该功能,企业客户可获得更多选项。
OpenAI DevDay 2026:发布 Dots、GPT-6.1 Sol、Ultrafast 及多项平台更新
OpenAI 在 DevDay 2026 上发布了 Dots 常驻智能体、GPT-6.1 Sol 模型、Ultrafast 极速模式、Decisions API、Agents API、ChatGPT Spaces 和 B2B Marketplace,并宣布 ChatGPT 周活跃用户达 12 亿。GPT-6.1 Sol 以更低价格提供接近 Astra 的智能,但 OpenAI 因安全顾虑 scrapped 了 GPT-6.1 Astra。独立评测显示 GPT-6.1 Sol 在多项基准上表现优异,同时平台计划重新分层引发用户不满。
Cloudflare 推出 AI Gateway Auto Router 自动路由模型以降低 AI 成本
Cloudflare 在 AI Gateway 中推出 Auto Router 公开测试版,用户将模型设为 cloudflare/auto 后,系统会自动把每个请求路由到能力足够且成本更低的模型。Cloudflare 内部使用 OpenCode 测试显示成本节省最高达 30%,在内部知识工作基准上以 86.6% 成功率实现每成功任务 0.0084 美元,约为 GPT-6 Sol 成本的 80%、Claude Opus 5.5 成本的 35%。该路由器通过 Workers AI 上的多头分类模型判断任务类别与复杂度等维度,并过滤不健康或不符合策略的模型。
OpenAI DevDay 2026发布25项更新:GPT-6.1 Sol与常驻Agent Dots登场
OpenAI在旧金山举行DevDay 2026,一口气发布25项更新,覆盖ChatGPT、Codex、GPT-6模型和API。最重磅的是常驻型Agent产品Dots,以及性能接近GPT-6 Astra但API价格仅为其五分之一的GPT-6.1 Sol。Codex升级为云端软件工程团队,Agents API开放Computer Use与Codex能力,并推出Sign in with ChatGPT、Pro 500套餐和OpenAI Marketplace等商业化动作。此外,OpenAI正洽谈至少300亿美元新融资,目标投前估值约1.4万亿美元。
Cloudflare 推出 Monetization Gateway 测试版,用 HTTP 402 向 AI 代理收费
Cloudflare 宣布 Monetization Gateway 进入封闭测试,允许域名所有者通过 HTTP 402 状态码向 AI 代理按次收费,覆盖网站、API、MCP 工具和数据集。该网关通过 Coinbase 的 x402 Facilitator 完成支付验证与结算,使用 Base 区块链上的 USDC 稳定币。Cloudflare AI Gateway 已支持美国客户通过 PAYMENT-METHOD: x402 请求头按请求为推理付费。
模型发布
MODEL RELEASE1 篇DiffuRefill-1B:1.08B 掩码扩散语言模型预训练中
Hugging Face 上出现一个名为 DiffuRefill-1B 的 1.08B 参数掩码扩散语言模型预训练检查点,目前训练约进行到一半(约 10 万步 / 20 万步,约 460 亿有效 token)。该模型采用置信度定向重填充解码,整段序列约需 20 次并行去噪即可生成,而自回归模型每 token 需一次前向。训练通过 DiLoCo 在 3-5 台单 GPU 机器上同步进行,作者称其英语流畅但事实性仍不可靠,尚未做指令微调。
研究进展
RESEARCH3 篇面向资源受限边缘设备的神经符号路由可靠推理
该论文提出一种神经符号路由器,将查询分类为算术、代数、形式逻辑和文字题四类,前三类交由确定性求解器处理,仅文字题使用小语言模型。路由逻辑通过L*语法推断算法学习DFA实现,以SLM作为成员查询预言机、标注数据作为等价预言机。在Raspberry Pi 4B上运行Phi-4-mini(3.8B,Q6_K量化),对DeepMind Mathematics、GSM8K和RuleTaker的100个未测试提示进行评估,路由准确率达100%,整体准确率98.3%,优于最强基线Program-of-Thought的72.0%和工具调用智能体的58.7%,且延迟降低8.8倍、能耗降低2.8倍。
HERO:面向肿瘤学的鲁棒病理学编码器
该论文提出 HERO(Histology Encoder for Robust Representation in Oncology),一个基于 ViT-G/14 的病理学基础模型,使用 DINO 和 iBOT 目标训练,并在约 57.5 万张临床全切片图像、5 亿个形态学均衡的切片上通过高分辨率 Gram anchoring 进行精炼。作者指出,现有病理基础模型在临床跨医院、扫描仪和染色方案使用时,编码器会混入采集因素,影响下游预测安全。HERO 在 PathoROB 和 PLISM 等基准上展现出最强的采集偏移鲁棒性,在 39 个切片级临床任务中平均排名第一,并在六个基准框架的等权分析中取得最佳平均排名。
无声自由度中的回放:无需离线阶段的持续学习
该论文提出一种无需离线阶段的持续学习方法,利用局部睡眠机制在推理过程中进行回放巩固。方法包含隔离规则、不应期旋转规则以及两个内部信号(稳态压力和相对新颖性门控),在类增量split-MNIST上达到或超过最佳离线夜间调度,与DER++持平,并优于经验回放等方法。旋转规则贡献主要增益,隔离规则提供不变性保证;在split CIFAR-10上落后于ER-ACE和DER++两到三个百分点。
开源项目
OPEN SOURCE1 篇llama.cpp b11279 新增 GLM-5.3-Flash 支持
llama.cpp 发布 b11279 版本,新增对 GLM-5.3-Flash(GLM5-Next)模型的支持,包含 MTP、多流、稀疏 FA 等优化,并修复了 k-pool 布局、状态回滚、GPU 图重分配等多个缺陷。该更新由社区贡献者提交,部分修复由 Claude Opus 5 和 Codex 辅助完成。
安全
SECURITY1 篇Anthropic:智谱开源模型GLM-5.3漏洞利用能力逼近Claude Mythos Preview
Anthropic 前沿红队发布分析称,智谱(海外品牌 Z.ai)的开源权重模型 GLM-5.3 在漏洞利用开发能力上已接近 Claude Mythos Preview:在 ExploitBench 上 410 次尝试中成功构建可用漏洞利用 50 次,Mythos Preview 为 56 次;内部二进制利用基准上 GLM-5.3 完全控制目标程序的比例为 4%,Mythos Preview 为 6%。Anthropic 指出 GLM-5.3 发布时缺乏有效安全防护,可通过伪装红队任务、预填推理步骤乃至 abliteration 去除拒答行为来绕过限制,并称已有开发者发布解锁版本。美国 CAISI 的独立评估也认为 GLM-5.3 是迄今网络能力最强的开源权重模型,落后美国最佳模型约四个月。