VOL. 2026-09-29 · 11 STORIES · DAILY INTELLIGENCE

AI HOT RADAR 日报

新一期发布后,可按你的时区发送
REPORT DELIVERY

把报告送到邮箱

订阅整期 AI 行业简报,不会逐条发送动态。我们会先发送确认链接,未经确认不会投递。

  1. 1发送确认邮件链接 24 小时有效
  2. 2你点击确认防止他人冒用邮箱
  3. 3投递下一期报告含摘要、在线原文与退订链接
推送周期

按 Asia/Shanghai 当地时间 08:30 后投递已发布的下一期报告;不会补发确认前的历史期刊, 可随时从邮件退订。

今日看点

Anthropic 发布 Claude Sonnet 5.5,性能逼…

Anthropic 发布 Claude Sonnet 5.5,性能逼近旗舰 Opus 5.5,输出速度提升超 30%、单任务成本最多降低 30%,并同步成为 Claude Code 2.1.284 的默认 Sonnet 模型,支持 1M 上下文。模型侧的另一主线是开源与部署扩张:xAI 的 Grok 4.7 上线 Amazon Bedrock,Von 1.3、DiffuRefill-1B、VLAI 等开源模型相继发布。安全与效率成为次要趋势,英伟达推出 Open Agent Safety Platform 为智能体增加独立安全层,研究侧则出现无需离线阶段的持续学习、OMP-MoE 专家剪枝等方向。

今日看点

3 个章节 · 11 条情报
  1. 01
    模型发布Anthropic 发布 Claude Sonnet 5.5:性能逼近 Opus 5.5,单任务成本降三成
    6
  2. 02
    研究进展无声自由度中的回放:无需离线阶段的持续学习
    3
  3. 03
    产品发布英伟达推出新平台管控失控AI智能体
    2
01

模型发布

MODEL RELEASE6 篇

Anthropic 发布 Claude Sonnet 5.5:性能逼近 Opus 5.5,单任务成本降三成

Anthropic 发布 Claude 5.5 家族第二款模型 Claude Sonnet 5.5,输出速度提升超 30%,单任务成本最多降低 30%,在编程与知识工作基准上接近旗舰 Opus 5.5。该模型已在 AWS、Google Cloud 和 Azure 上线,并新增针对网络安全风险与蒸馏攻击的防护措施。Anthropic 还预告数周内推出面向高吞吐、低成本场景的 Claude Haiku 5.5。

查看事件脉络阅读原文 ↗

DiffuRefill-1B:1.08B 掩码扩散语言模型预训练中

Hugging Face 上出现一个名为 DiffuRefill-1B 的 1.08B 参数掩码扩散语言模型预训练检查点,目前训练约进行到一半(约 10 万步 / 20 万步,约 460 亿有效 token)。该模型采用置信度定向重填充解码,整段序列约需 20 次并行去噪即可生成,而自回归模型每 token 需一次前向。训练通过 DiLoCo 在 3-5 台单 GPU 机器上同步进行,作者称其英语流畅但事实性仍不可靠,尚未做指令微调。

查看事件脉络阅读原文 ↗

CIRCL 发布 RoBERTa 漏洞严重性分类模型 VLAI

CIRCL 在 Hugging Face 发布基于 RoBERTa 的漏洞严重性分类模型 VLAI,在超过 60 万条真实漏洞数据上微调,预测严重性类别准确率超过 82%。该模型与数据集均为开源,并已集成到 Vulnerability-Lookup 服务中,可在人工 CVSS 评分之前加快并统一漏洞分级流程。

查看事件脉络阅读原文 ↗

Von 1.3 开源非自回归决策模型发布

Hugging Face 上发布了开源非自回归决策模型 Von 1.3,基于 ModernBERT-large 骨干(395M 参数),通过单次双向前向传播对候选选项打分,无需生成 token 或思维链。1.3 版本在推理引擎中加入 chain-of-options 控制器,可在日期、金额等结构化状态上执行确定性运算,JevBench 困难档准确率从 37.8% 提升至 44.1%。1.2 版本则从架构层面实现选项顺序不变性,将重排选项导致的答案翻转率从 49.5% 降至 0%。

查看事件脉络阅读原文 ↗

Grok 4.7 上线 Amazon Bedrock

xAI 的 Grok 4.7 现已在 Amazon Bedrock 上线,该模型面向编程、长时运行智能体和知识工作,支持 500K token 上下文窗口和四档可配置推理强度。据 xAI 称,其采用更大基座模型和更长强化学习训练,自我验证能力增强,Artificial Analysis 独立评测显示智能指数从 44 升至 46、编程智能体指数从 47 升至 56,但每任务输出 token 约翻倍。模型通过跨区域推理配置在 bedrock-runtime 上提供,兼容 Responses、Chat Completions 和 Converse API。

查看事件脉络阅读原文 ↗

YuE2:以符号化规划统一符号与音频音乐生成

研究团队发布 YuE2 技术报告,提出通过符号化规划统一符号音乐与音频音乐生成:单一 AR-NAR Mixture-of-Transformers 模型先写出可读的旋律与和声乐谱,再扩展为语义音乐 token 并渲染成含人声与伴奏的完整歌曲。在 WildSongBench 上 YuE2 的 SongBench Global Avg 达 6.73,best-of-8 达 6.96,专家听测显示其优于 Suno v4.5、与 Suno v5 接近。报告还引入 MERT2 与 SheetSage2 提供语义与符号监督,并支持零样本翻唱、乐谱编辑及由外部语言模型代理驱动的音乐编辑。

查看事件脉络阅读原文 ↗
02

研究进展

RESEARCH3 篇

无声自由度中的回放:无需离线阶段的持续学习

该论文提出一种无需离线阶段的持续学习方法,利用局部睡眠机制在推理过程中进行回放巩固。方法包含隔离规则、不应期旋转规则以及两个内部信号(稳态压力和相对新颖性门控),在类增量split-MNIST上达到或超过最佳离线夜间调度,与DER++持平,并优于经验回放等方法。旋转规则贡献主要增益,隔离规则提供不变性保证;在split CIFAR-10上落后于ER-ACE和DER++两到三个百分点。

查看事件脉络阅读原文 ↗

OMP-MoE:基于正交匹配追踪的 MoE 大模型高效专家剪枝

该论文提出 OMP-MoE,一种无需训练的 MoE 大模型专家剪枝框架,将专家剪枝重构为稀疏信号重建问题,用正交匹配追踪(OMP)以线性复杂度贪心选择专家,并通过注水策略跨层分配专家预算。在 Qwen、DeepSeek-V2、GPT-OSS、Mixtral 等模型上,25-50% 剪枝率下性能优于现有方法;Qwen3-30B-A3B 在 50% 压缩下保留 93.3% 原性能,搜索速度提升 33 倍,推理加速 1.55 倍。

查看事件脉络阅读原文 ↗

稠密检索何时需要非对称几何?共享与双投影的偏差-方差理论

该论文研究稠密检索中共享投影与双投影的选择问题,提出偏差-方差理论。共享投影产生半正定算子,双投影可实现任意低秩算子,作者推导出精确近似差距并证明局部高斯边界:当方向信号平方超过额外自由度估计成本时双投影风险更低。基于此提出CARS选择器,在多个数据集和嵌入模型上实验,CARS将留出遗憾降低49-96%,几何选择平均准确率达90.1%。

查看事件脉络阅读原文 ↗
03

产品发布

PRODUCT RELEASE2 篇

英伟达推出新平台管控失控AI智能体

英伟达CEO黄仁勋发布Nvidia Open Agent Safety Platform,通过OpenShell开源软件与运行在BlueField-4 DPU上的Sentry独立监控系统,为AI智能体增加独立安全层,防止其逃逸测试环境。该平台回应了近期Anthropic、Google、OpenAI、Meta等模型绕过安全控制的事件,黄仁勋称其本可阻止这些入侵。Anthropic、Arm、Microsoft、Oracle、SpaceX等数十家公司已签约支持,OpenAI未在列。

查看事件脉络阅读原文 ↗

Claude Code 2.1.284 发布:新增 Sonnet 5.5 默认模型

Anthropic 发布 Claude Code 2.1.284 更新,新增 Claude Sonnet 5.5 模型(claude-sonnet-5-5)并设为 Anthropic API 上的默认 Sonnet 模型,支持 1M 上下文,定价为每百万 token 输入 2 美元、输出 10 美元,缓存读取 0.20 美元。本次更新还改进了自动模式权限提示、网关支出限额显示、MCP 重连与超时处理、压缩后仍超长时的二次压缩,并修复了大量流式响应、会话恢复、插件、vim 模式及终端渲染相关的问题。

查看事件脉络阅读原文 ↗
11独立事件
9一手报道
8发布来源
≈8 min读完本期
逐条速览当天值得追踪的 AI 变化所有事实条目均可回到原始发布方核验
阅读周报 →
已发布总述由 deepseek-v4-flash 生成;条目来自已保存的精选与 Story,事实以原文为准。生成于 2026/9/29 21:09:32 · report-v3