VOL. 2026-08-26 · 12 STORIES · DAILY INTELLIGENCE
AI HOT RADAR 日报
2026-08-26 · PUBLISHED · 约 9 分钟
今日AI行业焦点集中在芯片与推理性能的竞争上
今日AI行业焦点集中在芯片与推理性能的竞争上。OpenAI在Hot Chips大会展示了自研推理芯片Jalapeño,声称在每瓦吞吐量和token延迟上超越Nvidia的Blackwell和Rubin,标志着头部玩家加速自研硬件。与此同时,NVIDIA Dynamo推出影子引擎恢复功能,将LLM推理故障恢复时间从283秒大幅降至7.3秒,显著提升系统韧性。模型生态方面,社区发布了多个无审查量化版本(如Ornith-1.5-35B-A3B和Qwen3.8-27B),并保留MTP头,同时IBM推出超快语音识别模型Granite Speech 5.0 Turbo CTC。研究层面,重正化群流匹配、等变细胞层等新方法为生成建模和分子电子结构学习提供了可扩展方案。此外,AWS和Google分别推出MCP Apps和AgentHands,强化了AI在可观测性与XR交互中的应用。苹果则发布搭载2nm M6芯片的Mac mini及M5系列Mac Studio,并联合阿里巴巴训练面向中国市场的AI大模型,推动端侧AI能力升级。
今日看点
3 个章节 · 12 条情报- 01产品发布OpenAI自研芯片Jalapeño基准测试超越Nvidia Blackwell和Rubin5
- 02模型发布Ornith-1.5-35B-A3B Abliterated GGUF 发布:九层量化与 MTP 头3
- 03研究进展重正化群流匹配:可扩展的局部生成建模4
产品发布
PRODUCT RELEASE5 篇OpenAI自研芯片Jalapeño基准测试超越Nvidia Blackwell和Rubin
OpenAI在Hot Chips大会上展示了其首款自研推理芯片“Jalapeño”的基准测试结果,声称其在每瓦吞吐量和token延迟上优于Nvidia的Blackwell和Rubin芯片。该芯片由OpenAI与博通合作开发,历时约16个月,其中设计周期仅9个月,并使用了OpenAI自身的模型辅助设计。SemiAnalysis的测试显示,Jalapeño在性能功耗比上大幅领先,但尚未量产,且未采用多token预测等优化技术。
NVIDIA Dynamo 影子引擎恢复:秒级恢复 LLM 推理容量
NVIDIA Dynamo 推出影子引擎恢复预览功能,通过 GPU 内存服务(GMS)在活动引擎旁保持一个完全初始化的空闲引擎,并共享权重,避免冷重启。在 GLM-5.2 双工作节点部署中,故障恢复时间从 283 秒降至 7.3 秒,提速约 39 倍。该功能解决了权重与进程绑定及初始化状态不可转移的问题,支持 vLLM、SGLang 和 TensorRT-LLM 集成。
Amazon OpenSearch Service MCP Apps 实现 IDE 内可观测性验证
AWS 发布了 Amazon OpenSearch Service MCP Apps,该功能扩展了 Model Context Protocol,使 AI 代理的工具调用能返回交互式可视化结果(如追踪瀑布图、服务拓扑图),直接在 IDE 聊天窗口中渲染。这解决了可观测性代理验证环节需要切换浏览器、手动核对的问题,让工程师在对话线程内完成验证。MCP Apps 由本地 MCP 服务器、IDE 和 OpenSearch UI 应用协同工作,数据保留在用户 AWS 账户中,确保控制权和安全性。
Amazon Quick Desktop 与 FSx for ONTAP 集成实现治理式周报自动化
AWS 发布了 Amazon Quick Desktop 与 Amazon FSx for NetApp ONTAP 的集成方案,支持治理式 AI 辅助周报生成。该方案通过 S3 访问点控制文件访问,利用知识库和技能实现自动化报告,并将报告准备时间从数小时缩短至数分钟。文章提供了详细的技术架构和部署前提条件。
苹果发布M6/M5 Pro Mac mini及Mac Studio,AI性能大幅提升
苹果发布新款Mac mini和Mac Studio,Mac mini首发2nm M6芯片,AI性能大幅提升,Mac Studio搭载M5 Max/Ultra芯片,支持本地运行大模型。同时,苹果与阿里巴巴联合训练面向中国市场的AI大模型,推进Apple智能落地。此外,苹果计划在9月发布折叠屏iPhone等新品。
模型发布
MODEL RELEASE3 篇Ornith-1.5-35B-A3B Abliterated GGUF 发布:九层量化与 MTP 头
gbuzhf 发布了 Ornith-1.5-35B-A3B 的 abliterated 版本,并提供了九个 GGUF 量化层级,每个层级都嵌入了 MTP 头。测量显示 abliteration 对模型的影响小于 Q6_K 量化,且与量化损伤呈次可加性,量化不会使模型恢复拒绝行为。
Qwen3.8-27B 无审查 GGUF 量化版发布,保留 MTP 头
JonathanColetti 发布了 Qwen3.8-27B 的无审查 GGUF 量化版本,通过 Heretic 工具去除拒绝行为,并保留多 token 预测(MTP)头。该模型提供多种量化级别和视觉变体,并附有困惑度测量数据,显示除 IQ2_M 外各量化级别性能相近。此发布旨在为本地部署提供更少限制的模型选项。
IBM 发布 Granite Speech 5.0 Turbo CTC:超快语音识别模型
IBM 发布 Granite Speech 5.0 Turbo CTC 系列,包含两个 470M 参数的英语语音识别模型,在 NVIDIA H200 GPU 上实现超过 12,600 RTFx 的吞吐量,可每秒转录超过 3.5 小时的语音。模型采用编码器-only 设计,相比前代速度提升 20 倍以上,适合边缘设备使用。非商业版本(CC-BY-NC-SA-4.0)在 OpenASR 上 WER 为 4.85%,Apache 2.0 版本为 5.00%。
研究进展
RESEARCH4 篇重正化群流匹配:可扩展的局部生成建模
本文提出重正化群流匹配(RGFM)框架,利用重正化群流作为概率路径,从长波长到短波长逐步生成数据,实现局部生成建模。理论证明RGFM概率流可由局部速度场近似,计算成本随系统体积近线性增长。在FFHQ图像上,RGFM相比局部流匹配显著提升全局一致性和FID分数。
等变细胞层用于分子电子结构:连接层上同调与E(3)等变哈密顿学习
本文提出了一种新的等变细胞层网络(ECSN),将分子电子结构哈密顿量建模为细胞层的拉普拉斯算子,并证明了其与E(3)等变哈密顿学习之间的联系。该方法通过层上同调提供了非键轨道的拓扑不变量,并在数值实验中验证了嵌入精度、等变性和旋转泛化能力。该工作统一了等变消息传递网络与拓扑深度学习,为电子结构预测提供了新的理论框架。
临界深度平衡模型的响应重整化
本文提出了一种名为响应重整化(Response Renormalization)的框架,用于改善深度平衡模型(DEQ)的训练稳定性。该方法通过在后向传播中提升选定的近极点分母,同时保留未提升的响应通道,从而控制临界邻域内的伴随放大。实验表明,在23个多物理场系列中,使用该方法训练的模型在超过98%的静态和95%的瞬态比较中,测试误差与精确隐式微分训练的模型相差不超过5%。
Google 推出 AgentHands:为 XR 对话代理生成同步手部手势
Google Research 发布了 AgentHands,一个基于 LLM 的 XR 原型系统,通过同步的、富有表现力的手部手势为对话代理提供空间锚定的指导,以弥合心理映射差距并增强用户在物理任务中的参与度。该系统利用眼动追踪和场景重建进行对象注册,并构建了包含指示性、象形性和表达性三类手势的库,通过词级时间戳实现语音与手势的同步。在 CHI 2026 发表的研究中,用户研究(N=12)表明,与仅语音的基线相比,AgentHands 在空间接地交互中更有效。该研究由 Google XR 团队主导,Ziyi Liu 为主要研究者。