VOL. 2026-09 · 12 STORIES · MONTHLY REVIEW
AI HOT RADAR 月报
2026-09-01 — 2026-09-30 · PUBLISHED · 约 10 分钟
本月AI行业格局呈现明显的多线收敛与分化态势
本月AI行业格局呈现明显的多线收敛与分化态势。在模型能力边界上,DeepSeek-V4-Flash-Vision-Exp的开源将多模态与智能体能力推向新高度,多项基准超越Opus-4.8,而Google TimesFM-3则在时间序列预测这一垂直领域确立了零样本基础模型的新标杆,显示通用大模型与领域基础模型正并行演进。同时,效率优化成为贯穿各条目的主线:微软通过知识蒸馏将病理模型压缩50倍计算量,Qwen3.8-27B针对AMD平台的ROCmFP4量化实现2.83倍加速,llama.cpp对Intel GPU的OpenCL路径优化,均指向同一趋势——在算力受限场景下,通过量化、蒸馏和硬件适配来扩展模型可用性。跨条目的归纳判断是,行业正从单纯追求参数规模转向“能力-效率-场景”的三角平衡,开源生态中出现了明显的垂直分化:宗教文本识别(Nemotron古兰经模型)、金融多模态(MoziAI-35B)等小众场景获得定制化模型,而工具链(Strands SDK、Langfuse)则加速向MCP v2、后台任务等标准化能力收敛。此外,NVIDIA在自动驾驶(Omniverse NuRec)和生命科学(BioNeMo与Claude Science集成)的布局,暗示基础设施厂商正将AI能力嵌入行业工作流,而非仅提供通用模型。整体来看,本月变化表明,模型发布密度虽高,但竞争焦点已从单一基准分数转向实际部署效率与生态整合,这一趋势推测将在未来数月持续强化。
本月格局
3 个章节 · 12 条情报- 01模型发布Qwen3.8-27B ROCmFP4 量化版发布,针对 AMD Strix Halo 优化,MTP 加速 2.83 倍6
- 02产品发布llama.cpp b10723 发布:优化 Intel Xe-LP GPU 的 OpenCL 量化性能4
- 03教程与实践NVIDIA Omniverse NuRec:跨车辆平台扩展自动驾驶感知2
模型发布
MODEL RELEASE6 篇Qwen3.8-27B ROCmFP4 量化版发布,针对 AMD Strix Halo 优化,MTP 加速 2.83 倍
kingjones777 发布了 Qwen3.8-27B 的 ROCmFP4 量化版本,专为 AMD Strix Halo 平台优化,并捆绑了多 token 预测(MTP)草稿头。该构建在 AMD Ryzen AI Max+ 395 上实现了 30.30 tok/s 的解码速度,相比标准 Q4_K_M 提升 2.83 倍,同时困惑度与 Q4_K_M 相当(5.8877 vs 5.8926)。作者还发布了 MTP 调优曲线,发现 llama.cpp 默认的 --spec-draft-n-max 16 并非最优,最佳值为 3-4。该模型仅适用于 ROCmFPX 分支的 llama.cpp,标准 llama.cpp 无法加载。
Google 发布 TimesFM-3:零样本多变量时间序列预测基础模型
Google Research 发布了 TimesFM-3,这是一个 3.3 亿参数的多变量时间序列基础模型,支持零样本预测,并在 Gift-Eval、FEV-Bench 和 Time 等基准测试中取得领先性能。该模型采用解码器 Transformer 架构和连续补丁掩码策略,可在单次前向传播中生成整个预测区间,并支持外部协变量。相比前代模型,TimesFM-3 显著提升了多变量场景下的预测准确性。
微软发布高效病理基础模型GigaPath-Flash和GigaTIME-Flash
微软研究院发布GigaPath-Flash和GigaTIME-Flash,通过知识蒸馏将十亿参数模型压缩为紧凑的ViT-S编码器,分别实现约50倍计算量降低和6倍速度提升,同时保持或提升病理分析性能。这两个模型以Apache 2.0协议开源,旨在支持大规模人群级病理研究,但仅限研究用途,未经临床验证。
Nemotron 3.5古兰经双头ASR模型v5
该模型基于NVIDIA Nemotron 3.5流式ASR(0.6B)微调,用于全古兰经诵读识别,支持Uthmani脚本及泰吉威德符号,并增加音素头用于错误检测。最佳检查点(step 78000)在留出集上达到CER 2.76%、WER 4.43%、变音符号F1 98.27%。训练数据包含179,376个片段(约868小时),模型参数全部可训练。
DeepSeek-V4多模态模型开源,多项基准超越Opus-4.8
DeepSeek于8月31日开源了其V4系列首个实验性多模态模型DeepSeek-V4-Flash-Vision-Exp,该模型基于V4-Flash架构并集成视觉模块,解锁了视觉理解能力。在多项基准测试中,该模型在纯文本智能体任务和多模态智能体能力上表现优异,部分指标超越Opus-4.8,但在复杂数据科学任务上仍有差距。此前该模型已于8月21日上线DeepSeek API平台。
MoziAI-35B-V3.8:开源多模态模型,支持本地部署与金融优化
MoziAI-35B-V3.8 是由中国金融意见领袖陈玉墨团队开发的开源多模态 AI 模型,基于 Ornith-1.5-35B-A3B 构建,支持本地部署和免费商用。该模型集成了动态七维思维框架、Agent LOOP 迭代机制、MoziSmartBit 混合量化算法及金融垂直领域优化,压缩后约 15.9GB,保持约 99% 的 FP16 精度。模型支持多语言、视觉理解和多种推理框架,旨在降低本地部署门槛并实现零 token 成本。
产品发布
PRODUCT RELEASE4 篇llama.cpp b10723 发布:优化 Intel Xe-LP GPU 的 OpenCL 量化性能
llama.cpp 发布 b10723 版本,主要针对 Intel Xe-LP GPU 优化 OpenCL 量化路径,通过调整 Q4_K/Q5_K 的矩阵乘法分块大小和 N_DST 参数,提升其 TG 和 PP 性能。该版本同时提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。
Strands Agents SDK TypeScript v1.16.0 发布
Strands Agents SDK 发布了 typescript/v1.16.0 版本,新增了后台任务、MCP v2 兼容、BM25 全文搜索等功能,并修复了多项问题。该版本还包含文档更新和依赖升级,旨在提升 SDK 的功能性和稳定性。
Langfuse v4.26.0 发布:新增 API 预览与评估追踪,修复多项问题
Langfuse 发布了 v4.26.0 版本,主要新增了 API 规范预览和评估器执行追踪链接功能,并修复了结构化输出中的推理冲突、OpenAI 工具 schema 嵌套及无状态调用等问题。此外,该版本还优化了 OTel 数据解析和 Web 组件重构。
OpenClaw 2.0 发布:史上最大更新,安装简化但仍有门槛
智东西报道,OpenClaw 2.0 在停更7周后发布,这是其史上最大更新,涉及安装流程、浏览器界面、共享会话等全面翻新。新版本由 OpenClaw Foundation 运营,创始人加入 OpenAI 但项目保持独立。实测显示安装更简单,支持导入 Hermes 记忆,但仍有极客风格,对非开发者不友好。社区反响不一,有人认为其丰富了开源生态,也有人仍偏爱 Hermes。
教程与实践
TUTORIAL2 篇NVIDIA Omniverse NuRec:跨车辆平台扩展自动驾驶感知
NVIDIA 发布了 Omniverse NuRec 技术,用于跨车辆平台扩展自动驾驶感知系统。该技术利用 3D 高斯泼溅重建真实驾驶场景,并渲染目标车辆配置的新相机视图,使开发者无需为每个车型收集和标注新数据集即可适配感知模型。教程展示了从重建场景、渲染目标视图到训练感知模型的完整流程,并提供了包含 1500 多个场景的 Physical AI NuRec 数据集。
NVIDIA BioNeMo 与 Claude Science 集成,实现蛋白质结构预测
NVIDIA 与 Anthropic 合作,将 BioNeMo Agent Toolkit 集成到 Claude Science 中,使 AI 代理能够直接调用 BioNeMo NIM 微服务进行蛋白质结构预测。该工具包将生命科学模型封装为代理可调用的技能,在内部基准测试中将任务正确率从 60% 提升至 100%,并将 token 效率提高约一倍。教程展示了在配备 NVIDIA GPU 的机器上,通过 Claude Science 使用 MSA 搜索、OpenFold3 和 Boltz-2 三个 NIM 端点,对 Seh1 蛋白及其预测伙伴进行单链和复合物结构预测的工作流程。