VOL. 2026-09-15 · 11 STORIES · DAILY INTELLIGENCE

AI HOT RADAR 日报

新一期发布后,可按你的时区发送
REPORT DELIVERY

把报告送到邮箱

订阅整期 AI 行业简报,不会逐条发送动态。我们会先发送确认链接,未经确认不会投递。

  1. 1发送确认邮件链接 24 小时有效
  2. 2你点击确认防止他人冒用邮箱
  3. 3投递下一期报告含摘要、在线原文与退订链接
推送周期

Asia/Shanghai 当地时间 08:30 后投递已发布的下一期报告;不会补发确认前的历史期刊, 可随时从邮件退订。

今日看点

2026-09-15 共精选 11 条内容,覆盖 4 个类别

2026-09-15 共精选 11 条内容,覆盖 4 个类别。

今日看点

4 个章节 · 11 条情报
  1. 01
    模型发布ZGCM-1:面向数学与智能体搜索的全开源高效基础模型
    4
  2. 02
    研究进展难度感知拓扑选择:多智能体代码生成的自适应协作
    3
  3. 03
    开源项目llama.cpp b10981:优化 OpenVINO 有状态解码与 GPU MoE 推理
    3
  4. 04
    产品发布Cloudflare 推出 Disallow AI Training 设置,兼顾搜索可见性与拒绝 AI 训练
    1
01

模型发布

MODEL RELEASE4

ZGCM-1:面向数学与智能体搜索的全开源高效基础模型

中关村学院与中关村人工智能研究院发布 ZGCM-1,一个完全开源的 7B 稠密基础模型,面向数学推理与智能体搜索,从零训练并开源权重、数据、代码与日志。该模型采用混合注意力、FP8 Muon 优化器和 MDP 中期训练等高效方案,在 16K 预训练上实现 4.2 倍时间到损失加速。评测显示其在 7B 规模推理基准上领先,并在部分数学与智能体搜索任务上接近参数量大得多的前沿模型。

查看事件脉络阅读原文 ↗

cRia-LM-75M:75.7M 参数递归 Transformer 基座模型发布

Hugging Face 上发布了 cRia-LM-75M,一个 75.7M 参数的基座语言模型,采用 Relaxed Recursive Transformer(RRT)架构,用 11 层共享循环块执行两次遍历,第二次遍历使用 rank-172 LoRA 参数。训练分三阶段:Stage 1 在 10B token 上预训练 2K 上下文,Stage 2 用 2B token 预算做能力中训并采用双教师蒸馏,Stage 3 将上下文扩展到 4,096 token。该模型为未做指令微调的基座模型,使用 SmolLM2 分词器,遵循 SmolLM2-135M 层设计并加入 QK-Norm。

查看事件脉络阅读原文 ↗

Biohub 发布 60 亿参数蛋白质语言模型 ESMC-6B

Biohub 在 Hugging Face 上发布 ESMC-6B 蛋白质语言模型,拥有 60 亿参数、80 层,基于 UniRef、MGnify 和 JGI 的蛋白质序列训练。同时开源了 300M 和 600M 参数变体,并基于冻结的 ESMC-6B 训练了 ESMFold2 结构预测模型和稀疏自编码器。该模型可用于蛋白质表示、变体效应预测和蛋白质工程等 AI 应用。

查看事件脉络阅读原文 ↗

TAARDIS-27B 全三值量化模型发布:1.75bit 仅 5.9GB

开发者 CodeMasterCody3D 在 Hugging Face 发布 TAARDIS-27B 全三值量化模型,基于 Qwen3.8-27B,将全部权重(含 LM head 与 embedding)压至 1.75 bit/权重、5.90 GB,并附带 496 个跨层低秩三值修正分支 The Doctors,使 Wikitext 困惑度从 13.61 降至 11.83。该模型需使用作者自建的 llama.cpp 分支运行,原版会输出乱码;作者称其单人 51 天完成,转换配方开源,体积小于 PrismML 的 Ternary-Bonsai-27B,但质量仍略低。

查看事件脉络阅读原文 ↗
02

研究进展

RESEARCH3

难度感知拓扑选择:多智能体代码生成的自适应协作

该研究指出多智能体代码生成系统通常固定使用单一通信拓扑,但实验发现层级协作相对单智能体的优势随问题难度从2.4分(简单)升至21.1分(困难),而token成本始终约为10倍。作者提出Difficulty-Aware Topology Selector(Dats),用图网络预测各拓扑解题概率并结合成本选择最优拓扑,在预算匹配协议下以40%的层级成本达到77.7% pass@1,优于始终层级(73.6%)和最强学习基线(74.3%)。

查看事件脉络阅读原文 ↗

自索引注意力:兼容压缩的稀疏长上下文 LLM 推理

该论文提出 Self-Indexing Attention,一种无需训练的稀疏长上下文 LLM 推理框架,基于共享的变换域符号-幅值表示,将 key 的符号位复用为 token 级索引,同时服务于 prefill 分组选择与 decode 检索,并与外部 KV-cache 压缩兼容。在 5% 注意力密度下,该方法在 LongBench 和 RULER 上接近稠密注意力,prefill 与 decode 注意力算子分别最高加速 6.1 倍和 10.3 倍,端到端加速 1.35 倍。实验还表明其与 TurboQuant 低比特 KV-cache 压缩及 DeepSeekV4-Flash 的预训练稀疏注意力索引器兼容。

查看事件脉络阅读原文 ↗

Google 发布 AI 与经济 ATLAS 新洞察及交互体验

Google 发布 AI & Economy ATLAS 的新洞察,并推出开放访问的交互式体验,展示不同职业和国家的 AI 使用情况。数据显示印度创意产业 AI 使用率高于全球,美国技术类职业领先。Google、Google DeepMind 与 MIT FutureTech 合作研究还发现近半数受访科学家每天使用 AI,每周节省近 7 小时,但验证输出和假设积压带来新瓶颈。

查看事件脉络阅读原文 ↗
03

开源项目

OPEN SOURCE3

llama.cpp b10981:优化 OpenVINO 有状态解码与 GPU MoE 推理

llama.cpp 发布 b10981 版本,主要针对 OpenVINO 后端进行优化,涵盖有状态解码、GPU MoE 推理、KV 状态重排、RoPE 与归一化翻译等。修复了 Gemma-4 等模型因逐层 KV 头数/头尺寸差异导致解码乱码的问题,并拒绝无法从 KV 状态恢复的有状态解码。性能上,GPU 上 gemma-4-12B 在深度 8192 时从 6.27 提升至 9.11 t/s,Llama-3.2-1B 从 47.8 提升至 59.6 t/s。

查看事件脉络阅读原文 ↗

ShadowPEFT 正式加入 Hugging Face PEFT 库

Hugging Face 的 PEFT 库正式将 ShadowPEFT 纳入为一等方法。ShadowPEFT 与 LoRA 的适配器几何结构根本不同,但共用 get_peft_model 入口和适配器保存/加载路径。它引入一个带持久隐藏状态的有状态影子模型,在每层进行影子注入、基础编码和影子更新,实现跨层协调,并让任务特定组件成为可独立推理的模型。

查看事件脉络阅读原文 ↗

llama.cpp v0.4.1 发布:新增多模型支持并升级 ggml

llama.cpp 发布 v0.4.1,新增 Maple 20B-A1B 三元 MoE、腾讯 Hy 4 预览版和 Spark2.5 模型支持,并改进 JSON schema 处理、聊天解析、日志和服务器子进程管理。核心变更包括修复 DeepSeek2、GLM-MoE 等模型的 MTP KV 缓存分配,以及 Qwen/Kimi/GLM 的 GDN 归一化问题。同时 ggml 升级至 v0.24.0,扩展了后端覆盖与精度控制 API。

查看事件脉络阅读原文 ↗
04

产品发布

PRODUCT RELEASE1

Cloudflare 推出 Disallow AI Training 设置,兼顾搜索可见性与拒绝 AI 训练

Cloudflare 推出新的 Disallow AI Training 设置,允许网站主在保留搜索引擎索引的同时拒绝同一爬虫将内容用于 AI 训练。Apple、Google 和 Microsoft 已承诺或已支持该设置。Cloudflare 还推出 Accountable 认定,要求爬虫运营方提供训练退出机制、AI 摘要退出机制、URL 级可见性,并保证退出训练不影响传统搜索。

查看事件脉络阅读原文 ↗
11独立事件
11一手报道
8发布来源
8 min读完本期
逐条速览当天值得追踪的 AI 变化所有事实条目均可回到原始发布方核验
阅读周报
已发布总述由 确定性模板 生成;条目来自已保存的精选与 Story,事实以原文为准。生成于 2026/9/15 21:49:53 · report-v3