VOL. 2026-09-01 · 12 STORIES · DAILY INTELLIGENCE

AI HOT RADAR 日报

新一期发布后,可按你的时区发送
REPORT DELIVERY

把报告送到邮箱

订阅整期 AI 行业简报,不会逐条发送动态。我们会先发送确认链接,未经确认不会投递。

  1. 1发送确认邮件链接 24 小时有效
  2. 2你点击确认防止他人冒用邮箱
  3. 3投递下一期报告含摘要、在线原文与退订链接
推送周期

Asia/Shanghai 当地时间 08:30 后投递已发布的下一期报告;不会补发确认前的历史期刊, 可随时从邮件退订。

今日看点

当日AI行业焦点集中在模型量化与推理加速上,Qwen3.8-27B成…

当日AI行业焦点集中在模型量化与推理加速上,Qwen3.8-27B成为热点,ISTA-DASLab发布非均匀量化GGUF支持多模态,kingjones777的ROCmFP4版本在AMD Strix Halo上解码速度提升2.83倍。同时,llama.cpp连续发布多个版本,b10731优化Qwen4Exp的MTP解码,b10724将KV缓存恢复时间从数十秒降至毫秒级,b10737则修复了qwen4exp架构问题。此外,Stability AI推出Stable Audio 3 Optimized加速版,LMDeploy v0.17.0集成DeepEPv2并支持Kimi K2.6,微软发布高效病理基础模型GigaPath-Flash和GigaTIME-Flash。研究方面,AgenticRag-R1通过栈内存强化学习提升多步推理检索,Google的TimesFM-3在零样本时间序列预测上取得领先,而Rasch测量理论揭示了LLM评分与人类的系统性差异。

今日看点

3 个章节 · 12 条情报
  1. 01
    模型发布ISTA-DASLab 发布 Qwen3.8-27B 非均匀量化 GGUF,支持多模态与推测解码
    5
  2. 02
    产品发布llama.cpp b10731 发布:支持 Qwen4Exp 循环状态回滚,提升 MTP 解码速度
    4
  3. 03
    研究进展AgenticRag-R1:基于栈内存的智能体强化学习实现多步推理与检索
    3
01

模型发布

MODEL RELEASE5

ISTA-DASLab 发布 Qwen3.8-27B 非均匀量化 GGUF,支持多模态与推测解码

ISTA-DASLab 发布了 Qwen3.8-27B 的 GSQ-RCO 非均匀量化 GGUF 文件,提供四种不同比特率的量化版本,并附带视觉投影器以支持多模态应用。这些量化模型在保持标准 GGUF 格式兼容 llama.cpp、Ollama 和 LM Studio 的同时,通过梯度搜索优化每个张量的量化类型,在低比特率下接近或达到 BF16 基线的性能。其中 IQ3_S 版本被推荐为任务无损的操作点,在 AIME25 和 LiveCodeBench v6 上完全匹配基座模型,且体积仅为 BF16 的五分之一。

查看事件脉络阅读原文 ↗

Qwen3.8-27B ROCmFP4 量化版发布,AMD Strix Halo 上解码速度提升 2.83 倍

kingjones777 发布了 Qwen3.8-27B 的 ROCmFP4 量化版本,专为 AMD Strix Halo 平台优化,并捆绑了多 token 预测(MTP)草稿头。该版本在 AMD Ryzen AI Max+ 395 上实现了 30.30 tok/s 的解码速度,是标准 Q4_K_M 的 2.83 倍,同时困惑度与 Q4_K_M 持平。作者发布了详细的基准测试和 MTP 调优曲线,并指出 llama.cpp 默认的 --spec-draft-n-max 值并非最优。

查看事件脉络阅读原文 ↗

Stability AI 发布 Stable Audio 3 Optimized 加速版

Stability AI 发布了 Stable Audio 3 Optimized,这是一系列针对特定硬件加速优化的实验性检查点,基于潜在扩散模型,支持可变长度音频生成和编辑。模型在 H200 GPU 上生成音频不到 2 秒,在 MacBook Pro M4 上仅需几秒,并提供了 TFLite/LiteRT 优化 CPU 运行时。该模型使用 T5Gemma 进行文本条件处理,训练数据包含来自 AudioSparx 和 Freesound 的授权音频,并已过滤版权内容。

查看事件脉络阅读原文 ↗

Google 发布 TimesFM-3:零样本多变量时间序列预测基础模型

Google Research 发布了 TimesFM-3,这是一个 3.3 亿参数的多变量时间序列基础模型,支持零样本预测,并在 Gift-Eval、FEV-Bench 和 Time 等基准测试中取得领先性能。该模型采用解码器 Transformer 架构和连续补丁掩码策略,可在单次前向传播中生成整个预测区间,并支持外部协变量。相比前代模型,TimesFM-3 显著提升了多变量场景下的预测准确性。

查看事件脉络阅读原文 ↗

微软发布高效病理基础模型GigaPath-Flash和GigaTIME-Flash

微软研究院发布GigaPath-Flash和GigaTIME-Flash,通过知识蒸馏将十亿参数模型压缩为紧凑的ViT-S编码器,分别实现约50倍计算量降低和6倍速度提升,同时保持或提升病理分析性能。这两个模型以Apache 2.0协议开源,旨在支持大规模人群级病理研究,但仅限研究用途,未经临床验证。

查看事件脉络阅读原文 ↗
02

产品发布

PRODUCT RELEASE4

llama.cpp b10737 发布:修复 qwen4exp 并新增测试

llama.cpp 发布 b10737 版本,主要针对 qwen4exp 架构进行修复,包括序列并行、块位置键控、多模态输入、CUDA 中止等问题,并新增了序列状态保存/恢复的测试。该版本还禁用了 qwen4exp 的 -sm tensor 支持,并提供了 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。

查看事件脉络阅读原文 ↗
03

研究进展

RESEARCH3

AgenticRag-R1:基于栈内存的智能体强化学习实现多步推理与检索

AgenticRag-R1 是一个基于强化学习的框架,通过内存栈和细粒度动作空间深度融合推理、检索和记忆,并采用分层动作感知奖励和信息感知轨迹拒绝策略,以解决现有 RAG 系统在多步推理中自适应检索和上下文修订的不足。实验表明,该方法在多个多跳、开放域和智能体推理基准上优于强基线,并展现出更稳健、可解释且记忆感知的推理行为。代码已在 GitHub 上匿名公开。

查看事件脉络阅读原文 ↗

参数化多模态用户记忆:存储字幕无法承载的感知信息

本文提出了一种参数化多模态用户记忆方法,将感知记忆(如声音、面部)以原生模态存储,通过VLM进行指代定位、专用编码器提取身份键,并利用AttMem记忆库以注意力令牌形式存储,无需外部检索。实验表明,该方法在跨年龄、多说话人等场景下显著优于基于文本描述的记忆系统,弥补了纯文本记忆的不足。

查看事件脉络阅读原文 ↗

Rasch测量理论用于LLM评估:以LLM作为评分者的案例研究

该研究将Rasch测量理论应用于LLM评估,以LLM作为评分者标注仇恨言论为例,分析了九个LLM与人类评分者的差异。研究发现LLM在严重性、项目校准、问题顺序鲁棒性、目标身份敏感性和评分量表使用上系统性地偏离人类,这些差异在标准评估中会被掩盖。作者主张RMT应纳入LLM评估工具箱。

查看事件脉络阅读原文 ↗
12独立事件
12一手报道
8发布来源
9 min读完本期
逐条速览当天值得追踪的 AI 变化所有事实条目均可回到原始发布方核验
阅读周报
已发布总述由 deepseek-v4-flash 生成;条目来自已保存的精选与 Story,事实以原文为准。生成于 2026/9/1 22:12:48 · report-v3