VOL. 2026-W35 · 81 STORIES · WEEKLY SIGNALS
AI HOT RADAR 周报
2026-08-24 — 2026-08-30 · PUBLISHED · 约 51 分钟
本周AI领域呈现多条主线并进
本周AI领域呈现多条主线并进。在模型层面,Qwen3.8-27B成为生态焦点,多家机构围绕其推出量化版(如RedHatAI的NVFP4版、针对16GB显存的GGUF版)和投机解码草稿模型(如RadixArk的DSpark、非官方heretic-dflash),同时GLM-5.3-Flash也迎来NVFP4量化版,体积缩减70%,显示开源社区正通过量化与投机解码技术降低大模型部署门槛。推理基础设施方面,llama.cpp一周内密集发布多个版本,持续优化NPU支持(Hexagon、OpenVINO)、SYCL显存适配及Apple芯片调优,vLLM则重点优化Kimi-K3与DeepSeek V4性能,而NVIDIA推出TensorRT Model Connect简化开放模型部署,并发布Dynamo影子引擎恢复功能,将故障恢复时间从283秒降至7.3秒。硬件层面,OpenAI自研推理芯片Jalapeño宣称性能超越Blackwell,NVIDIA则发布Nemotron-3-Super 120B混合架构模型和Cosmos3全模态世界模型系列,SKT推出688B参数MoE模型A.X K2,显示大厂在算力与模型两端同时发力。此外,Anthropic发布MHS标准统一AI控制物理硬件接口,并与索尼、华纳陷入音乐版权诉讼,而LangChain、Agno等框架则通过MCP适配器、数据库迁移等更新强化代理生态。整体来看,本周趋势集中在模型压缩与推理优化、硬件创新、以及代理与物理世界交互的标准化推进上。
本周主线
6 个章节 · 81 条情报- 01模型发布GLM-5.3-Flash NVFP4 量化版发布:体积缩减70%17
- 02产品发布OpenAI 发布自研推理芯片 Jalapeño,性能超越 Blackwell40
- 03开源项目three.ws 开源栈:为 AI 代理提供身体、大脑、钱包与工作1
- 04研究进展模态成熟度指数:评估全模态模型多模态能力的基准19
- 05行业与商业索尼和华纳起诉Anthropic,指控其大规模盗用音乐版权训练AI1
- 06API 与平台更新OpenAI Node SDK v7.6.0 发布:新增混淆字段与安全增强3
模型发布
MODEL RELEASE17 篇GLM-5.3-Flash NVFP4 量化版发布:体积缩减70%
LibertAI 发布了 GLM-5.3-Flash 的 NVFP4 量化版本,将模型从 598.5 GiB 压缩至 181 GiB,体积减少 70%,余弦相似度达 0.99665。该量化仅针对路由专家 FFN,保留注意力、视觉塔等关键部分为 BF16,确保多模态行为与原始模型一致。模型支持 vLLM 和 SGLang,但需要特定配置,且已修复 GB10 上的兼容性问题。
NaviDC-OCR:轻量级文档解析模型,统一数字与拍摄文档
StarDoc-AI 发布了 NaviDC-OCR,一个约 1.2B 参数的开源视觉语言模型,专为文档解析设计,统一处理数字和相机拍摄文档。该模型引入了多节点共识投票、几何感知建模、曲率引导采样等技术,在 OmniDocBench 和 Wild_OmniDocBench 基准上达到最先进性能,且无需去畸变预处理。模型采用 Apache-2.0 许可证,支持中英日文。
Ornith-1.5-35B-A3B Abliterated 多量化等级 GGUF 发布
gbuzhf 发布了 Ornith-1.5-35B-A3B 模型的 abliterated 版本,并提供了九个不同量化等级的 GGUF 文件,每个都嵌入了 MTP 头。测量显示 abliteration 对模型的影响(KLD 0.0151)小于 Q6_K 量化(KLD 0.0222),且 abliteration 与量化损伤近似正交,不会使模型恢复拒绝行为。
Whittle MoE 27B:从 Qwen3.8 切分出的路由器修复型混合专家模型
Hugging Face 上发布了新模型 logic65/Qwen3.8-Whittle-MoE-27B-A17.8B,这是一个从 Qwen3.8-27B 中通过后验方式切分出的混合专家模型,总参数 27B,激活参数 17.8B。该模型通过仅训练路由器(冻结专家)恢复了性能,并新增了停止信号以解决推理中止问题。v2.2.1 修复了推理中止缺陷,但 GGUF 文件尚未更新。模型为研究预览版,计算预算已耗尽,依赖捐赠支持。
RadixArk 发布 Qwen3.8-27B-DSpark 投机解码草稿模型
RadixArk 发布了 Qwen3.8-27B-DSpark,这是一个为 Qwen3.8-27B 目标模型设计的投机解码草稿模型,使用 SpecForge 训练并由 SGLang 提供服务。该模型在 17 个工作负载上平均接受长度提升 26.45%,吞吐量最高提升 3.16 倍,相比 EAGLE 和自回归基线有显著性能提升。
Qwen3.8-27B 推出 16GB VRAM 优化 GGUF 量化版
Hugging Face 用户 tooltd 发布了 Qwen3.8-27B 的 GGUF 量化版本,针对 16GB VRAM 优化,采用自定义混合精度量化方法 ZB-ZipBrain,结合重要性矩阵校准和率失真边际成本,自动寻找帕累托最优的比特分配。该模型在 16GB 显卡上约 4 BPW,12GB 显卡上约 3 BPW,并通过基准测试对比了多种量化方法的困惑度和 KL 散度,声称在低比特下保持较好质量。
RedHatAI 发布 Qwen3.8-27B-NVFP4 量化模型
RedHatAI 发布了 Qwen3.8-27B-NVFP4,这是对 Qwen/Qwen3.8-27B 的混合精度量化版本,采用 FP4/FP8 方案,MLP 投影量化为 FP4,注意力投影和最终 MLP 层量化为 FP8,KV 缓存量化为 FP8,语言模型头保持全精度。该模型使用 LLM Compressor 结合 AWQ 与 GPTQ 在 perfectblend 数据集 512 样本上校准,检查点约 24.7 GB,相比 BF16 的约 54 GB 减少约 70% 的磁盘和显存需求。在 GSM8K Platinum、MATH-500、AIME 2025、GPQA Diamond、IFEval 和 SWE Bench 上评估,精度恢复率接近或超过 BF16 基线。
SKT 发布 688B 参数 MoE 模型 A.X K2,支持原生 FP8 训练
SKT 发布了 A.X K2,这是一个 6880 亿参数、330 亿激活参数的 MoE 语言模型,作为 A.X K1 的继任者,支持思考与非思考模式,并采用 Think-Fusion 训练方法。该模型原生 FP8 训练,支持 256K 上下文,并针对多语言和代码进行了优化。它是韩国政府主权 AI 基础模型项目的一部分,旨在提升韩语和文化理解能力。
Qwen3.8-Flash-Next在NVIDIA GB300 NVL72上支持代理编码
阿里巴巴发布了Qwen3.8-Flash-Next模型权重,作为Qwen4架构的预览,供开发者实验和评估。该模型是一个多模态MoE模型,主模型125B参数,附加51B N-gram嵌入,每token激活6B参数,原生上下文窗口262,144 token,可通过YaRN扩展到1M。NVIDIA提供了Day 0功能支持,包括SGLang、vLLM和TensorRT LLM,并在GB300 NVL72上验证推理性能,同时提供NeMo AutoModel和NeMo RL的微调与强化学习配方。该模型专为高容量、上下文密集型应用设计,如代理编码、文档处理和工具驱动工作流,其混合架构结合了Gated DeltaNet和Qwen Sparse Attention,以解决长上下文下的注意力计算和KV缓存瓶颈。在GB300 NVL72上,模型实现了每GPU每秒超过16K tokens的吞吐量,每用户每秒超过200 tokens,支持高吞吐低延迟的代理编码应用。
NVIDIA 发布 Nemotron-3-Super 120B 混合架构大模型
NVIDIA 发布了 Nemotron-3-Super-120B-A12B-FP8 大型语言模型,采用 LatentMoE 混合架构,总参数 120B,激活参数 12B,支持最长 1M token 的上下文,并内置多 token 预测(MTP)以加速生成。该模型针对智能体工作流、长上下文推理和高吞吐量场景(如 IT 工单自动化)进行了优化,支持多种语言,并采用 NVIDIA 开放模型许可。模型已可在 Hugging Face 上下载,并提供了技术报告和预训练/后训练数据集。
NVIDIA发布Cosmos3全模态世界模型系列
NVIDIA发布了Cosmos3系列全模态世界模型,包括Cosmos3-Edge、Nano、Super等多个版本,支持从文本、图像、视频和动作轨迹生成视频、图像、音频和动作输出,用于机器人、自动驾驶和智能空间等物理AI应用。该系列基于Mixture-of-Transformers架构,参数规模从4B到64B不等,并采用OpenMDW1.1许可证,可商用。
Ornith AI 发布 Ornith-1.5-35B-A3B 模型,以 3B 激活参数实现卓越编码性能
Ornith AI 发布了 Ornith-1.5-35B-A3B 模型,这是一个混合专家模型,每个 token 仅激活约 3B 参数。该模型通过端到端自我改进循环,联合优化任务生成、脚手架构建和解决方案生成,在编码和智能体基准测试中显著优于同尺寸的 Qwen 3.6-35B,并大幅超越 Gemma 4-31B 等密集模型。
Qwen3.8-27B-heretic-dflash:非官方 5 层 DFlash 投机解码草稿模型
jfan 发布了非官方的 Qwen3.8-27B-heretic-dflash 模型,这是一个基于 DFlash 架构的 5 层投机解码草稿模型,专为目标模型 trohrbaugh/Qwen3.8-27B-heretic-ara 设计。该模型目前训练至 10k/60k 步,在 Apple M5 Pro 上实现了约 41.6% 的解码加速,支持 MLX、vLLM 和 SGLang 等推理框架。
IBM 发布 Granite Speech 5.0 Turbo CTC:超快语音识别模型
IBM 发布 Granite Speech 5.0 Turbo CTC 系列,包含两个 470M 参数的英语语音识别模型,在 NVIDIA H200 GPU 上实现超过 12,600 RTFx 的吞吐量,可每秒转录超过 3.5 小时的语音。模型采用编码器-only 设计,相比前代速度提升 20 倍以上,适合边缘设备使用。非商业版本(CC-BY-NC-SA-4.0)在 OpenASR 上 WER 为 4.85%,Apache 2.0 版本为 5.00%。
Qwen3.6-27B PrismaSCOUT 量化版发布:NVFP4+BF16 混合精度,体积缩小 11%
Hugging Face 上发布了 Qwen3.6-27B 的 PrismaSCOUT 量化版本,采用 NVFP4+BF16 混合精度,大小为 20.17 GB,比之前的 5.5 bpp 版本小 11%。该版本通过 PrismaSCOUT 算法基于端到端 KL 散度选择位分配,而非逐层代理指标,旨在减少量化漂移。实测平均 KL 为 0.0779,相比其 BF16 源模型,但低于 PrismaScout-AQUA 的 0.0402。该模型适用于 vLLM 在 NVIDIA Blackwell 上部署,可节省显存以支持更长上下文和更高并发。
Google 发布 GlucoFM:面向连续血糖监测的基础模型
Google Research 发布了 GlucoFM,一种用于连续血糖监测(CGM)数据的轻量级自监督基础模型。该模型采用双流设计,分别建模缓慢血糖趋势和短期偏差,在糖尿病风险、胰岛素抵抗等多项代谢预测任务中超越了现有模型(如 GluFormer),并在餐后血糖反应预测中取得最低平均绝对误差。模型在 109,066 小时的未标记 CGM 数据上预训练,展现出强大的跨数据集迁移和少样本适应能力。
腾讯发布Hy4 Preview:770B参数开源模型,推理强度可调
腾讯今日发布开源权重文本输入模型Hy4 Preview,总参数量770B,激活参数49B,上下文窗口1M token,Hugging Face上体积1.56TB,相比7月的Hy3大幅提升。模型支持两种推理强度:默认'high'和'no_think'(禁用推理)。作者通过SVG生成测试展示了其推理轨迹,并指出推理文本使用截断英文以节省token。
产品发布
PRODUCT RELEASE40 篇OpenAI 发布自研推理芯片 Jalapeño,性能超越 Blackwell
在 Hot Chips 37 大会上,OpenAI 发布了自研推理芯片 Jalapeño,宣称其能效和延迟优于 NVIDIA GB200/GB300,实测每瓦性能提升 1.5-1.9 倍,端到端延迟降低 1.7-3.6 倍,并计划年底部署。此外,多个研究强调 agent 的 harness 质量和记忆系统设计对性能影响重大,而 Perplexity 推出了本地化产品 Portable Computer。
Agno v3.0.2 发布:新增集成与 MCP 改进
Agno 发布 v3.0.2 版本,包含多项行为变更、新集成和改进。行为变更包括运行元数据优先级调整、MCPConfig 拒绝未知字段、推理检测改为询问提供商等。新集成支持 Synthorai 模型提供商、WaveSpeed 图像视频生成、Serply 搜索工具包和 AtomicMail 邮件工具包。改进包括将 Agent/Team/Workflow 作为 MCP 工具发布、工具包作为 MCP 工具、MCP 工具标题和注释支持等。
Anthropic 发布 MHS 标准,统一 AI 控制物理硬件接口
Anthropic 推出了 Model Hardware Standard (MHS),旨在为 AI 代理提供统一接口以控制和读取物理设备,如实验室和工厂中的显微镜和机械臂。该标准基于 MCP 扩展,可将设备集成时间从数周缩短至数小时。早期测试显示,Claude 能自主优化工作流程并生成无需语言模型运行的脚本,但在物理因果理解上仍有局限,需要人工监督。
LiteLLM v1.100.0-rc.1 发布:镜像签名验证与多项修复
LiteLLM 发布 v1.100.0-rc.1 版本,所有 Docker 镜像均使用 cosign 签名,并提供了基于提交哈希和发布标签的验证方法。该版本包含多项修复和功能更新,包括 Anthropic 消息处理、复杂性路由器、提示缓存节省报告、模型注册表更新、代理搜索工具、MCP 工具集强制、以及多个测试和 UI 改进。
llama.cpp b10693 发布:支持 Hexagon 设备发现与按需会话
llama.cpp 发布 b10693 版本,主要新增对 Hexagon 设备发现和按需创建会话的支持,包括运行时发现可用 NPU 核心、延迟会话分配及清理设备接口,并提前拒绝不存在的设备。该版本同时提供多平台预编译二进制文件,涵盖 macOS、Linux、Windows、Android 等。
llama.cpp b10684 发布:改进 SYCL 显存适配算法
llama.cpp 发布 b10684 版本,改进了 SYCL 后端中 --fit 算法对 --fit-target 的遵循,更准确地计算给定上下文大小所需的峰值显存,避免 OOM 并减少过度保留。在 Arc b70 上测试,使用 unsloth 的 qwen3.8(Q4_K_XL)模型,配合 q8_0 KV 和 MTP,在 --fit-target 1 下可实现 262144 上下文完全可用。
llama.cpp b10696 发布:为 M3 Pro 添加 fa-vec 调优
llama.cpp 发布 b10696 版本,主要更新是为 Apple M3 Pro 芯片添加 fa-vec 调优,以解决相关性能问题。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
llama.cpp b10688 发布:为 M2 添加 fa-vec 调优
llama.cpp 发布 b10688 版本,主要更新是为 Apple M2 芯片添加了 fa-vec 调优(PR #27940),以提升性能。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
Salesforce 利用 SageMaker 推理组件实现多可用区高可用
Salesforce 在构建 Agentforce 时,面临 Amazon SageMaker AI 推理组件(IC)默认放置策略无法满足多可用区(Multi-AZ)高可用合规要求的问题。AWS 通过新增 SchedulingConfig 参数(含 AvailabilityZoneBalance 和 PlacementStrategy)实现了 IC 副本跨 AZ 和实例的精细放置控制。Salesforce 采用 SPREAD 策略优先故障隔离,实现了 8 倍基础设施成本降低,同时满足 2-AZ 合规要求。
Amazon SageMaker Feature Store 推出批量写入与记录发现新 API
AWS 宣布为 Amazon SageMaker Feature Store 推出两个新 API:BatchWriteRecord 和 ListRecords。BatchWriteRecord 允许在单个 API 调用中跨多个特征组写入最多 25 条记录,支持部分成功语义和 TTL 控制,解决了高吞吐量管道中逐条调用 PutRecord 的性能瓶颈。ListRecords 支持分页枚举在线存储中的记录标识符,适用于 Standard 和 In-Memory 存储层,解决了记录丢失后无法恢复的问题。这些 API 旨在提升 ML 特征管理的效率和可操作性。
NVIDIA TensorRT Model Connect:两命令部署开放模型
NVIDIA 发布了 TensorRT Model Connect,这是一个开源参考实现集合,旨在简化开放模型在 TensorRT 上的部署。用户可以通过两条命令将 Hugging Face 模型转换为原生 C++ 推理应用,无需深入编译器知识。该项目提供语义级和模块级 API,支持自定义 GPU 内核集成,并利用 AI 原生开发流程和夜间发布保持与开放模型生态同步。
llama.cpp b10672 发布:OpenVINO 更新与 NPU 支持增强
llama.cpp 发布 b10672 版本,主要更新 OpenVINO 后端至 2026.3.1,新增对 whisper.cpp 的支持,并优化 Qwen3.5 在 NPU 上的运行。该版本还引入了新的算子支持(如 RELU、POOL_2D 等),并修复了静态形状和分块预填充等问题。
EdgeFirst 发布 Model Zoo,提供真实硬件上的 YOLO 模型性能基准
EdgeFirst 发布了 Model Zoo,提供在真实硬件上测量并公开验证的 YOLO 模型性能数据,覆盖多种 NPU 和平台。所有测量结果均可复现,并附有详细的验证会话链接。该资源旨在帮助开发者基于可验证的数据选择边缘 AI 加速器,而非依赖厂商宣称的 TOPS 值。
LangChain 发布 1.4.0a2,推出 MCP 适配器集成
LangChain 发布了 langchain 1.4.0a2 的 alpha 预览版,引入了第一方适配器 langchain.mcp,可将任何 MCP 服务器转换为 LangChain 工具,直接用于 create_agent。该适配器支持多种传输方式,提供结构化输出、错误处理以及可选的 elicitation 中断机制,允许服务器在调用中向人类提问。此版本为 alpha 版本,API 可能在正式版前调整。
Google AI Mode 新增航班价格追踪、积分兑换和酒店预订功能
Google 在 AI Mode 中推出三项旅行规划新功能:航班价格追踪、积分/里程兑换查询以及酒店预订。用户可在对话中设置价格提醒,查看合作伙伴的积分兑换信息,并通过 Google Pay 完成酒店预订。这些功能已在全球或美国逐步上线,支持多家航空公司、酒店集团和预订平台。
Anthropic 发布模型硬件标准预览,加速 AI 驱动实验室自动化
Anthropic 与 HHMI Janelia 研究园区合作,发布了模型硬件标准(MHS)的研究预览版,旨在让 AI 代理安全操作物理设备。MHS 通过标准化驱动和自然语言标签,将设备集成时间从数周缩短至数分钟,并支持多设备并行操作。该标准已提供给首批科研实验室和制造商,未来将开源。
vLLM v0.28.0 发布:Kimi-K3 与 DeepSeek V4 性能优化
vLLM 发布 v0.28.0 版本,包含 584 个提交,重点优化了 Kimi-K3 和 DeepSeek V4 的性能,支持稀疏 MLA、DCP、FlashKDA 等特性,并改进了推测解码和模型运行器。该版本还引入了新的默认配置、破坏性变更,并扩展了模型支持,如 Muse Glimmer、Ling 3.0 Flash 等。
llama.cpp b10675 发布:Vulkan 后端优化 MoE 推理
llama.cpp 发布 b10675 版本,主要更新为 Vulkan 后端新增对 shader 中行 ID 和专家计数的提升支持,优化了 MoE 模型的推理性能。该版本提供了多平台预编译二进制,包括 macOS、Linux、Windows、Android 等。
NVIDIA Dynamo 影子引擎恢复:秒级恢复 LLM 推理容量
NVIDIA Dynamo 推出影子引擎恢复预览功能,通过 GPU 内存服务(GMS)在活动引擎旁保持一个完全初始化的空闲引擎,并共享权重,避免冷重启。在 GLM-5.2 双工作节点部署中,故障恢复时间从 283 秒降至 7.3 秒,提速约 39 倍。该功能解决了权重与进程绑定及初始化状态不可转移的问题,支持 vLLM、SGLang 和 TensorRT-LLM 集成。
Agno v3.0.0 发布:重大更新,需数据库迁移
Agno 发布 v3.0.0 重大版本更新,引入工具结果和媒体数据卸载、CodeMode、FinanceTools 等新功能,并重构数据库结构,新增 runs 表以提升性能。该版本还增强了 AgentOS 的持久化后台执行和 Studio 3.0 的治理目录,同时更新了多个模型提供商的默认模型。所有 2.x 用户需在升级前执行数据库迁移。
NVIDIA Spectrum-X 以太网:重写大规模 AI 网络规则
NVIDIA 发布了 Spectrum-X 以太网架构,专为大规模 AI 工厂设计,通过硬件加速的交换机和网卡协同设计,解决传统以太网在 AI 训练中的瓶颈。该架构采用自适应路由、硬件拥塞控制和平面负载均衡,在多租户场景下将训练步进时间稳定在 668 毫秒,而传统以太网在噪声流量下延迟至 1.18 秒。这显著提升了 AI 训练的性能和隔离性。
DeepSpeed v0.19.6 补丁发布:修复与 Apple Silicon 支持
DeepSpeed 发布了 v0.19.6 补丁版本,包含多项修复和功能改进,如修复 Ulysses 序列并行中的检查点选择、ZeRO-3 冻结参数问题,并新增对 Apple Silicon (MPS) 的支持(包括 Metal FusedAdam 内核)。此外,还实现了可配置的梯度求和归约、原生主机内存固定后端,以及 AutoTP 的不均匀分片和通用检查点支持。这些更新提升了 DeepSpeed 在多种硬件和场景下的稳定性和性能。
NVIDIA 发布 NVLink Fusion 与 NVHBM,提升定制 AI 基础设施性能
NVIDIA 发布了 NVLink Fusion 和 NVHBM 技术,旨在帮助超大规模企业和 AI 原生公司将其定制 XPU 和 CPU 集成到 NVIDIA AI 基础设施中。NVHBM 是定制 HBM 基底芯片技术,相比标准 HBM4e 可提供高达 30% 的带宽提升、25% 的计算芯片面积增加和 15% 的功耗降低。该技术通过减少内存接口面积和优化功耗,支持更大模型和更复杂的推理工作负载,并加速定制 AI 工厂的上市时间。
NVIDIA 发布 CUDA Python 1.0:稳定 API 与统一平台访问
NVIDIA 发布 CUDA Python 1.0,提供从 Python 访问完整 CUDA 平台的官方支持,包括 cuda.core、cuda.compute、cuda.bindings 等组件。该版本引入语义化版本控制,确保 API 稳定性,并统一了 Python GPU 生态的基础层,使不同库(如 Numba、cuda.compute)能在同一 GPU 缓冲区和流上协作。此举使 Python 成为与 C++ 同等的 CUDA 一等公民,降低了开发者使用高级平台功能(如绿色上下文)的门槛。
NVIDIA BlueField-4 驱动 Scale-In 网络,加速代理式 AI 工厂基础设施
NVIDIA 推出第五大 AI 网络支柱 Scale-In,专为代理式 AI 工厂设计,由 BlueField-4 DPU、DOCA 软件和 Spectrum-X 以太网驱动,提供安全、多租户、高性能的数据访问和基础设施操作。该架构将南北向网络整合为统一加速域,减轻主机 CPU 负担,提升安全性和效率。BlueField-4 还支持 NVIDIA BlueField Astra 扩展控制平面,并与 CMX 协同管理 KV 缓存。
Google ADK Python 2.8.0 发布:新增 A2A 任务模式与 Model Armor 防护
Google 发布了 ADK Python 2.8.0 版本,新增了 A2A 任务模式、Model Armor 防护插件、NVIDIA NIM 集成示例、数据代理工具集、BigQuery SQL 注入防护、自定义 LLM 客户端注入、Vertex AI API 版本配置、流式工具调度、实时模式视频支持、MCP 遥测、LLM 评估并行化、内存库支持、会话保留、子代理升级事件等多项功能。该版本还增强了遥测指标,包括 token 消耗和推理调用计数。
Transformers v5.16.0 发布,新增 Qwen4-Exp 等模型支持
Hugging Face Transformers 库发布 v5.16.0,新增多个模型支持,包括 Qwen4-Exp、GraniteSpeech5、Step3p7、CohereCompass 以及 ESMC 和 ESMFold2。这些模型覆盖了混合架构、语音识别、视觉语言、蛋白质语言与折叠等领域,提升了 Transformers 对前沿模型的支持能力。
llama.cpp 0.3.0 发布:新增多模态模型与多项推理优化
llama.cpp 0.3.0 版本发布,新增 dots3-note 多模态模型及 DSA-ISWA KV 缓存,支持 GLM-4.5-Air 的 MTP 预测,并为 DeepSeek 4 添加张量分割模式和多序列回滚修复。ggml 升级至 v0.22.0,服务器新增调试参数,Web UI 支持标签页聊天导航。
Dify v1.17.0 发布:Agent 沙箱、技能管理、统一追踪等新特性
Dify 发布 v1.17.0 版本,新增多项功能:Agent 支持 E2B 云沙箱、构建时快照和工作区级技能管理;工作流中可复用 LLM 环境变量;循环和迭代节点支持人工输入;提供统一追踪、Cloudflare Turnstile 验证码、Azure Key Vault KMS、TiDB 混合搜索等。此外,改进了无障碍性、工作流稳定性和内部测试质量。
MCP Python SDK v2.1.0 发布:增强客户端与内容支持
MCP Python SDK 发布 v2.1.0 版本,主要更新包括:Client 可直接接受 StdioServerParameters 对象,提示消息支持图像和音频,并导出相关消息类。请求体大小限制扩展到 SSE 和 OAuth 端点。行为变更包括:处理程序异常不再向客户端暴露详细信息,而是记录日志并返回通用错误;内容块返回注解不再自动生成 outputSchema,除非显式指定 structured_output。修复了 TypedDict 工具结果、递归返回类型、HTTP 通知确认等问题。
NVIDIA DSX MaxLPS:优化 AI 工厂每瓦性能
NVIDIA 发布了 DSX MaxLPS 技术套件,旨在提升 AI 工厂在固定电力预算下的吞吐量。该套件通过动态功率分配、软件优化和 45°C 温热水冷技术,将静态机架供电改为动态调度,可回收闲置功率并提升能效。其核心组件 Dynamic Power Software (DPS) 和 DSX Exchange 目前处于开发者预览阶段,有望显著提高 AI 数据中心的功率利用率。
Amazon Bedrock AgentCore Evaluations 实现跨框架代理评估
AWS 发布了 Amazon Bedrock AgentCore Evaluations,该服务通过 OpenTelemetry 标准解耦了代理评估与具体框架,支持 LangGraph、LlamaIndex、OpenAI Agents SDK 等多种框架。它自动读取调用代理、推理和工具执行三类 span,并利用 LLM-as-a-judge 进行统一评分,无需修改代理代码。此举解决了评估工具碎片化问题,提升了生产环境中代理评估的兼容性和效率。
Amazon OpenSearch Service MCP Apps 实现 IDE 内可观测性验证
AWS 发布了 Amazon OpenSearch Service MCP Apps,该功能扩展了 Model Context Protocol,使 AI 代理的工具调用能返回交互式可视化结果(如追踪瀑布图、服务拓扑图),直接在 IDE 聊天窗口中渲染。这解决了可观测性代理验证环节需要切换浏览器、手动核对的问题,让工程师在对话线程内完成验证。MCP Apps 由本地 MCP 服务器、IDE 和 OpenSearch UI 应用协同工作,数据保留在用户 AWS 账户中,确保控制权和安全性。
AWS 在 SageMaker HyperPod 上推出新的 Ray 集成能力
AWS 宣布在 SageMaker HyperPod 上推出新的 Ray 集成能力,使数据科学家能够通过 SageMaker Studio 直接创建和管理 Ray 集群,无需编写 Kubernetes 清单或使用 kubectl。该集成支持远程作业提交、交互式开发环境(JupyterLab/Code Editor)、自动故障恢复、分层检查点以及通过 SageMaker JumpStart 加载模型权重到 Ray Serve 端点。这些功能基于开源 KubeRay 和标准 Ray API,现有脚本无需修改即可运行。
Mastra 发布新存储后端、沙箱增强及多项破坏性变更
Mastra 发布 2026 年 8 月 26 日更新,新增 Elasticsearch 和 Valkey 存储后端,以及 E2B Desktop 计算机使用沙箱提供商。沙箱现在支持运行时环境控制和更安全的关闭行为,同时改进了可观测性、评分和流式会话体验。此版本包含多项破坏性变更,如 LSP 默认关闭和部分 API 调整。
LiteLLM v1.99.0-rc.2 发布:镜像签名验证与多项修复
LiteLLM 发布了 v1.99.0-rc.2 版本,该版本的所有 Docker 镜像均使用 cosign 进行签名,并提供了通过固定提交哈希或发布标签验证签名的方法。此版本还包含多项修复,包括 UI 回归修复、Vertex 实时和视觉图像测试修复,以及 Anthropic 消息桥接中 tool_result 文档块的翻译修复。
FINCHAL 金融预测挑战赛:区分运气与技能
Hugging Face 博客宣布举办 FINCHAL 金融预测挑战赛,这是一场 AI 与人类交易员的竞赛,涉及 NVIDIA、比特币、黄金和石油四种资产,总奖金 2000 美元。该竞赛旨在通过随机基准和自检评分代码来区分运气与技能,并允许 AI 代理与人类平等参与。竞赛采用仓位连续值(-1 到 1)的评分机制,并固定杠杆为 1,以避免过度投机。
llama.cpp b10604 发布,新增 DeepSeek 4 张量并行支持
llama.cpp 发布 b10604 版本,主要新增对 DeepSeek 4 的 tensor 并行支持,包括共享专家延迟 allreduce 等优化。该版本提供多平台二进制文件,涵盖 macOS、Linux、Windows、Android 等,并支持多种硬件后端。
LiteLLM v1.100.0-dev.1 发布:镜像签名验证及多项修复
LiteLLM 发布了 v1.100.0-dev.1 版本,该版本的所有 Docker 镜像均使用 cosign 进行签名,并提供了通过提交哈希或发布标签验证签名的方法。此版本包含多项修复和功能改进,包括修复 responses 桥接、新增 New Relic 按团队追踪、改进 Azure AI Foundry 的认证支持,以及多项 UI 和 CI 优化。
Agno v3.0.1 发布:性能优化与多项修复
Agno 发布了 v3.0.1 版本,主要改进包括缓存工具模式以加速多工具代理运行、增量加载会话历史以保持长对话响应速度,并为 PubMed 工具添加超时设置。修复了严格模式下工具模式缺少 properties 时的 KeyError、Gemini 工具结果媒体嵌套、核心安装位置查找依赖等问题。新增了确定性副作用审批流程、DeepKeep AI 防火墙等 cookbook 示例。
开源项目
OPEN SOURCE1 篇three.ws 开源栈:为 AI 代理提供身体、大脑、钱包与工作
three.ws 是一个开源平台,为 AI 代理提供 3D 生成、动画、支付和分发能力。其代码以 Apache-2.0 协议在 GitHub 上开源,模型托管在 Hugging Face。平台通过多引擎路由实现免费优先的 3D 生成,并支持照片到虚拟形象、骨骼动画、x402 支付标准及 MCP 集成。该平台旨在将代理的“身体、大脑、钱包和分发”整合为单一产品。
研究进展
RESEARCH19 篇模态成熟度指数:评估全模态模型多模态能力的基准
arXiv 论文提出 Modality Maturity Index (MMI) 基准,用于评估全模态模型在文本、图像、音频、视频和文档五种模态及其组合上的输入输出能力。MMI 包含 893 个问题,并引入 Modality Presence Score (MPS) 衡量模态生成能力。测试五个前沿模型发现 MPS 仅 15.6 至 34.9,表明现有模型多模态能力严重不足。
Procedura:基于程序化控制的智能体 3D 建模
arXiv 论文提出 Procedura,一个基于大语言模型的智能体 3D 建模框架,通过将形状表示为带类型约束的程序化装配(CSG),实现高精度、可编辑且具有部件分解的 3D 生成。在 P3D-Bench 和 MechBench-36 上,Procedura 超越了原生 3D 生成器和先前的 3D 代码智能体,无需 3D 训练即可从文本提示生成精细的多部件形状。
PACE:因子引导的长视频证据获取框架
香港科技大学团队提出PACE框架,用于长视频问答中的证据获取。PACE采用两阶段方法:先基于问题因子索引片段描述,再结合候选答案进行对比验证。在MMR-V基准上,PACE达到42.6%准确率,优于Deep Video Discovery等基线,并在多个长视频基准上表现一致。
GeoRA:为RLVR设计的几何感知低秩适配,获ACL 2026杰出论文
美团履约技术团队与北京大学联合提出了GeoRA,一种专为RLVR设计的低秩适配方法,通过谱先验和欧氏先验定位RLVR偏好的稀疏更新区域,再用SVD压缩为低秩适配器。实验表明,GeoRA在1.5B到32B的Qwen和Llama模型上,于数学、医学、代码等RLVR任务中稳定优于LoRA、PiSSA等基线,且训练参数降低99.5%,显存降低28.5%。该工作被ACL 2026接收为杰出论文,并已在美团AI骑手招聘场景中落地,效果与全参训练相当,相比LoRA提升约12%。
证据感知检索在RAG中的下游效用评估
本研究评估了RAG中证据感知检索评估的下游效用,发现其虽能改变检索排名,但在训练、系统选择及答案质量预测上并不稳定。人类注释确认过滤保留了证据,但不同评估器对答案质量改善结论不一,凸显了评估信号有效性的组合问题。
NeuronFuzz:利用安全神经元引导模糊测试评估大语言模型安全性
NeuronFuzz 提出了一种白盒模糊测试框架,利用模型内部安全神经元的激活作为连续反馈,用于评估大语言模型的安全性。该方法通过 SafetyOracle 在预填充阶段计算安全警报分数,避免了响应生成,从而提高了测试效率。实验显示,在五个白盒源模型上,NeuronFuzz 的越狱发现率达 76-100%,优于基线最多 48 个百分点,且优化模板可零样本迁移至开源和专有模型。
有限Newton-Schulz的平滑效应:Muon在非光滑非凸优化中的优势
本文研究了Muon优化器中有限Newton-Schulz迭代在非光滑非凸优化中的作用。作者通过在线到非凸转换分析,证明有限Newton-Schulz迭代将不连续的极分解映射平滑为Lipschitz映射,从而使得Muon能够收敛到驻点,而精确极分解更新可能无法收敛。该结果首次表明有限Newton-Schulz迭代是有益的而非近似误差,并扩展至一般谱映射。
OraRL:将标注作为轨迹的高效可扩展视频多模态强化学习
南开大学等机构提出 OraRL,一种面向视频多模态大模型的高效强化学习后训练方法。该方法将标注作为 oracle 轨迹加入策略组,并设计解耦优势估计器避免优势反转,显著提升训练效率与性能。OraRL 在多项视频感知基准上超越现有模型,且推理速度大幅提升。
Vibe Coding 实践、性能、生产力与风险:最新综述
这篇综述论文系统梳理了“Vibe Coding”(AI辅助软件开发)的实践、性能、生产力和风险。研究发现早期基准测试已饱和,但任务级能力不均衡,如代码生成可靠而故障检测薄弱。生产力证据看似矛盾,但通过统一测量方法可解释,并指出收益在新代码上真实,在成熟代码库上可能缩小或逆转。
XPerf:面向代理式 AI 工作负载的 LLM 服务系统基准测试框架
XPerf 是一个用于对 LLM 服务系统进行代理式 AI 工作负载基准测试的框架,它通过细粒度轨迹重放来确保可复现性,并提供系统和硬件性能的详细剖析。该框架默认包含八个代理应用,支持从真实应用中收集轨迹、合成新工作负载,并可在不同服务系统上重放。实证研究表明,XPerf 能准确重放代理工作负载,帮助识别性能瓶颈,并辅助系统调试。XPerf 将在 GitHub 上开源。
KVBoost:块级 KV 缓存复用与偏差引导重计算加速 LLM 推理
KVBoost 是一个面向 HuggingFace 兼容解码器模型的块级 KV 缓存复用系统,通过双哈希键控和偏差引导的重计算,解决了共享内容出现在提示任意位置时的缓存命中问题。在 Qwen2.5-3B 模型上,KVBoost 相比全量重计算实现了 4.49 倍的 TTFT 加速,比 vLLM 前缀缓存快 16%,且无质量损失。该系统支持 KV 量化、磁盘溢出缓存和自适应分块,可作为生产就绪的推理加速层。
临界深度平衡模型的响应重整化
本文提出了一种名为响应重整化(Response Renormalization)的框架,用于改善深度平衡模型(DEQ)的训练稳定性。该方法通过在后向传播中提升选定的近极点分母,同时保留未提升的响应通道,从而控制临界邻域内的伴随放大。实验表明,在23个多物理场系列中,使用该方法训练的模型在超过98%的静态和95%的瞬态比较中,测试误差与精确隐式微分训练的模型相差不超过5%。
等变细胞层用于分子电子结构:连接层上同调与E(3)等变哈密顿学习
本文提出了一种新的等变细胞层网络(ECSN),将分子电子结构哈密顿量建模为细胞层的拉普拉斯算子,并证明了其与E(3)等变哈密顿学习之间的联系。该方法通过层上同调提供了非键轨道的拓扑不变量,并在数值实验中验证了嵌入精度、等变性和旋转泛化能力。该工作统一了等变消息传递网络与拓扑深度学习,为电子结构预测提供了新的理论框架。
重正化群流匹配:可扩展的局部生成建模
本文提出重正化群流匹配(RGFM)框架,利用重正化群流作为概率路径,从长波长到短波长逐步生成数据,实现局部生成建模。理论证明RGFM概率流可由局部速度场近似,计算成本随系统体积近线性增长。在FFHQ图像上,RGFM相比局部流匹配显著提升全局一致性和FID分数。
检索需要多向量:单向量与多向量嵌入的指数级分离
该研究首次证明了在检索排序任务中,单向量嵌入与多向量嵌入之间存在指数级表达能力差距。作者构造了显式的查询-文档相关性矩阵族,其中多向量嵌入只需多项式大小即可正确排序,而单向量嵌入需要指数大小。基于理论构造,他们提出了ANDOR基准,实验显示单向量模型在零样本和微调后均表现不佳,而多向量模型持续领先,验证了理论预测。
SimGuide:程序化多上下文表示实现个性化代理规划
本文提出 SimGuide 方法,将用户上下文结构化为类型化、领域特定的 Sims 块,并用程序化示例进行约束,以解决个性化 AI 代理将用户视为单一实体而导致的冲突问题。作者构建了 SimBench 基准(47 个任务),实验表明程序化约束的 Sims 在 GPT-4o 上比 RAG 方法提升 7.9 个偏好遵循点,并在 Claude Sonnet 4.5 上得到验证。此外,基于 Sim 类型的 LoRA 微调比基于用户身份的适配额外提升 7.3 ROUGE-L 点,表明表示格式是首要设计变量。
Google 推出 AgentHands:为 XR 对话代理生成同步手部手势
Google Research 发布了 AgentHands,一个基于 LLM 的 XR 原型系统,通过同步的、富有表现力的手部手势为对话代理提供空间锚定的指导,以弥合心理映射差距并增强用户在物理任务中的参与度。该系统利用眼动追踪和场景重建进行对象注册,并构建了包含指示性、象形性和表达性三类手势的库,通过词级时间戳实现语音与手势的同步。在 CHI 2026 发表的研究中,用户研究(N=12)表明,与仅语音的基线相比,AgentHands 在空间接地交互中更有效。该研究由 Google XR 团队主导,Ziyi Liu 为主要研究者。
面向大规模供应链的可靠LLM决策引擎:架构、安全与性能保证
本文提出了一种名为LLM-DE的混合架构,将大语言模型与数学优化、概率预测和安全约束决策过滤相结合,用于大规模供应链运营中的需求预测、库存优化、运输路线规划和中断缓解。该架构通过安全过滤模块确保决策符合预定的安全与合规水平,旨在弥合AI推理与运筹学系统之间的差距,提供更智能、更安全且可扩展的供应链决策。研究为下一代智能供应链基础设施提供了实用的理论和算法基础。
非洲AI心理健康聊天机器人:系统综述与文化适应性框架
该论文对2017至2025年间52项关于AI心理健康聊天机器人的实证研究进行了系统综述,发现这些工具在提升可及性和缓解焦虑抑郁方面具有潜力,但多数系统基于西方模型和英语设计,缺乏对非洲文化、语言和基础设施的适应性。作者提出了一个融合非洲文化价值观、多语言设计、移动优先优化和伦理保障的文化适应性数字心理健康(CADMH)框架,为非洲医疗保健中的AI聊天机器人整合提供指导。
行业与商业
BUSINESS1 篇索尼和华纳起诉Anthropic,指控其大规模盗用音乐版权训练AI
索尼音乐和华纳音乐等主要音乐出版商起诉AI公司Anthropic及其高管,指控其未经许可使用数万首受版权保护的音乐作品(主要是歌词)训练Claude模型,并称这是历史上最大规模的公然知识产权盗窃之一。诉讼重点在于Anthropic获取训练数据的方式,包括通过非法种子下载盗版书籍和从授权平台抓取歌词。此前Anthropic已因类似问题支付了15亿美元和解金。
API 与平台更新
API UPDATE3 篇OpenAI Node SDK v7.6.0 发布:新增混淆字段与安全增强
OpenAI 发布了 Node SDK v7.6.0,新增了 ChatCompletionChunk 的混淆字段、项目驻留和用量单位字段,并支持后端中介的 Realtime WebRTC 调用及命名数据驻留端点。同时,该版本强化了 X.509 工作负载令牌交换和租户隔离,并修复了多项安全漏洞,包括流式响应中的身份验证和事件流边界问题。
OpenAI Python SDK v3.4.0 发布:新增 API 字段并修复多项问题
OpenAI 发布了 Python SDK v3.4.0,新增了 ChatCompletionChunk 的混淆字段、项目驻留配置和成本数量单位等 API 功能,并修复了多个 Azure 认证、WebSocket 重定向和 SSE 解码等问题。该版本还改进了文档和代码结构,提升了 SDK 的稳定性和安全性。
OpenAI Java SDK v4.53.0 发布:新增数据驻留与 WebRTC 支持
OpenAI 发布了 Java SDK v4.53.0,新增了 ChatCompletionChunk 混淆、项目驻留和用量单位支持、后端中介的 Realtime WebRTC 调用、固定别名 X.509 传输能力以及命名数据驻留端点。同时修复了并发 JSON 反序列化失败和流 ID 保留等问题,并升级了多个依赖。