VOL. 2026-09-01 · 12 STORIES · DAILY INTELLIGENCE
AI HOT RADAR 日报
2026-09-01 · PUBLISHED · 约 9 分钟
当日AI行业焦点集中在模型量化与推理加速上,Qwen3.8-27B成…
当日AI行业焦点集中在模型量化与推理加速上,Qwen3.8-27B成为热点,ISTA-DASLab发布非均匀量化GGUF支持多模态,kingjones777的ROCmFP4版本在AMD Strix Halo上解码速度提升2.83倍。同时,llama.cpp连续发布多个版本,b10731优化Qwen4Exp的MTP解码,b10724将KV缓存恢复时间从数十秒降至毫秒级,b10737则修复了qwen4exp架构问题。此外,Stability AI推出Stable Audio 3 Optimized加速版,LMDeploy v0.17.0集成DeepEPv2并支持Kimi K2.6,微软发布高效病理基础模型GigaPath-Flash和GigaTIME-Flash。研究方面,AgenticRag-R1通过栈内存强化学习提升多步推理检索,Google的TimesFM-3在零样本时间序列预测上取得领先,而Rasch测量理论揭示了LLM评分与人类的系统性差异。
今日看点
3 个章节 · 12 条情报- 01模型发布ISTA-DASLab 发布 Qwen3.8-27B 非均匀量化 GGUF,支持多模态与推测解码5
- 02产品发布llama.cpp b10731 发布:支持 Qwen4Exp 循环状态回滚,提升 MTP 解码速度4
- 03研究进展AgenticRag-R1:基于栈内存的智能体强化学习实现多步推理与检索3
模型发布
MODEL RELEASE5 篇ISTA-DASLab 发布 Qwen3.8-27B 非均匀量化 GGUF,支持多模态与推测解码
ISTA-DASLab 发布了 Qwen3.8-27B 的 GSQ-RCO 非均匀量化 GGUF 文件,提供四种不同比特率的量化版本,并附带视觉投影器以支持多模态应用。这些量化模型在保持标准 GGUF 格式兼容 llama.cpp、Ollama 和 LM Studio 的同时,通过梯度搜索优化每个张量的量化类型,在低比特率下接近或达到 BF16 基线的性能。其中 IQ3_S 版本被推荐为任务无损的操作点,在 AIME25 和 LiveCodeBench v6 上完全匹配基座模型,且体积仅为 BF16 的五分之一。
Qwen3.8-27B ROCmFP4 量化版发布,AMD Strix Halo 上解码速度提升 2.83 倍
kingjones777 发布了 Qwen3.8-27B 的 ROCmFP4 量化版本,专为 AMD Strix Halo 平台优化,并捆绑了多 token 预测(MTP)草稿头。该版本在 AMD Ryzen AI Max+ 395 上实现了 30.30 tok/s 的解码速度,是标准 Q4_K_M 的 2.83 倍,同时困惑度与 Q4_K_M 持平。作者发布了详细的基准测试和 MTP 调优曲线,并指出 llama.cpp 默认的 --spec-draft-n-max 值并非最优。
Stability AI 发布 Stable Audio 3 Optimized 加速版
Stability AI 发布了 Stable Audio 3 Optimized,这是一系列针对特定硬件加速优化的实验性检查点,基于潜在扩散模型,支持可变长度音频生成和编辑。模型在 H200 GPU 上生成音频不到 2 秒,在 MacBook Pro M4 上仅需几秒,并提供了 TFLite/LiteRT 优化 CPU 运行时。该模型使用 T5Gemma 进行文本条件处理,训练数据包含来自 AudioSparx 和 Freesound 的授权音频,并已过滤版权内容。
Google 发布 TimesFM-3:零样本多变量时间序列预测基础模型
Google Research 发布了 TimesFM-3,这是一个 3.3 亿参数的多变量时间序列基础模型,支持零样本预测,并在 Gift-Eval、FEV-Bench 和 Time 等基准测试中取得领先性能。该模型采用解码器 Transformer 架构和连续补丁掩码策略,可在单次前向传播中生成整个预测区间,并支持外部协变量。相比前代模型,TimesFM-3 显著提升了多变量场景下的预测准确性。
微软发布高效病理基础模型GigaPath-Flash和GigaTIME-Flash
微软研究院发布GigaPath-Flash和GigaTIME-Flash,通过知识蒸馏将十亿参数模型压缩为紧凑的ViT-S编码器,分别实现约50倍计算量降低和6倍速度提升,同时保持或提升病理分析性能。这两个模型以Apache 2.0协议开源,旨在支持大规模人群级病理研究,但仅限研究用途,未经临床验证。
产品发布
PRODUCT RELEASE4 篇llama.cpp b10731 发布:支持 Qwen4Exp 循环状态回滚,提升 MTP 解码速度
llama.cpp 发布 b10731 版本,新增对 Qwen4Exp 模型循环状态回滚的支持,以优化 MTP 投机解码性能。该更新通过为每个槽位写入快照,修复了卷积状态恢复问题,使解码速度在代码和散文场景下分别提升至 183 和 144 tok/s,相比之前有显著提升。
LMDeploy v0.17.0 发布:集成 DeepEPv2 并支持 Kimi K2.6
LMDeploy 发布 v0.17.0 版本,集成了 DeepEPv2,支持 Kimi K2.6 和 mooncake store,并优化了 GLM-5.2 服务性能。该版本还引入了服务端 fan-out、PDL 分页注意力、FP8 MoE 优化等改进,并修复了多个 bug。
llama.cpp b10737 发布:修复 qwen4exp 并新增测试
llama.cpp 发布 b10737 版本,主要针对 qwen4exp 架构进行修复,包括序列并行、块位置键控、多模态输入、CUDA 中止等问题,并新增了序列状态保存/恢复的测试。该版本还禁用了 qwen4exp 的 -sm tensor 支持,并提供了 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。
llama.cpp b10724 发布:KV 缓存恢复性能大幅优化
llama.cpp 发布 b10724 版本,优化了 KV 缓存状态恢复时非连续单元格的散列读取性能,通过按连续运行批量复制,将恢复时间从 25-63 秒降至 221-424 毫秒,并增加了相关测试。
研究进展
RESEARCH3 篇AgenticRag-R1:基于栈内存的智能体强化学习实现多步推理与检索
AgenticRag-R1 是一个基于强化学习的框架,通过内存栈和细粒度动作空间深度融合推理、检索和记忆,并采用分层动作感知奖励和信息感知轨迹拒绝策略,以解决现有 RAG 系统在多步推理中自适应检索和上下文修订的不足。实验表明,该方法在多个多跳、开放域和智能体推理基准上优于强基线,并展现出更稳健、可解释且记忆感知的推理行为。代码已在 GitHub 上匿名公开。
参数化多模态用户记忆:存储字幕无法承载的感知信息
本文提出了一种参数化多模态用户记忆方法,将感知记忆(如声音、面部)以原生模态存储,通过VLM进行指代定位、专用编码器提取身份键,并利用AttMem记忆库以注意力令牌形式存储,无需外部检索。实验表明,该方法在跨年龄、多说话人等场景下显著优于基于文本描述的记忆系统,弥补了纯文本记忆的不足。
Rasch测量理论用于LLM评估:以LLM作为评分者的案例研究
该研究将Rasch测量理论应用于LLM评估,以LLM作为评分者标注仇恨言论为例,分析了九个LLM与人类评分者的差异。研究发现LLM在严重性、项目校准、问题顺序鲁棒性、目标身份敏感性和评分量表使用上系统性地偏离人类,这些差异在标准评估中会被掩盖。作者主张RMT应纳入LLM评估工具箱。