VOL. 2026-08-24 · 12 STORIES · DAILY INTELLIGENCE
AI HOT RADAR 日报
2026-08-24 · PUBLISHED · 约 8 分钟
当日AI行业最显著的变化集中在基础设施与模型两端:NVIDIA密集发…
当日AI行业最显著的变化集中在基础设施与模型两端:NVIDIA密集发布Spectrum-X以太网、DSX MaxLPS和BlueField-4驱动的Scale-In网络,从网络架构、能效调度到代理式AI工厂基础设施全面重塑AI算力底座;模型侧则迎来SKT 688B参数MoE模型A.X K2和Ornith-1.5-35B-A3B等高效MoE新作,前者支持原生FP8训练与256K上下文,后者以3B激活参数在编码基准上表现突出。同时,Agno v3.0.0、Haystack v3.1.0及llama.cpp b10604等开发工具链的迭代,以及OraRL、XPerf等研究进展,共同指向多模态强化学习、代理式AI工作负载评测与AI辅助软件开发(Vibe Coding)等应用层面的深化探索。
今日看点
3 个章节 · 12 条情报- 01产品发布Agno v3.0.0 发布:重大更新,需数据库迁移6
- 02模型发布Whittle MoE 27B:从 Qwen3.8 裁剪的专家混合模型,路由器修复后性能恢复3
- 03研究进展OraRL:将标注作为轨迹的高效可扩展视频多模态强化学习3
产品发布
PRODUCT RELEASE6 篇Agno v3.0.0 发布:重大更新,需数据库迁移
Agno 发布 v3.0.0 重大版本更新,引入工具结果和媒体数据卸载、CodeMode、FinanceTools 等新功能,并重构数据库结构,新增 runs 表以提升性能。该版本还增强了 AgentOS 的持久化后台执行和 Studio 3.0 的治理目录,同时更新了多个模型提供商的默认模型。所有 2.x 用户需在升级前执行数据库迁移。
NVIDIA Spectrum-X 以太网:重写大规模 AI 网络规则
NVIDIA 发布了 Spectrum-X 以太网架构,专为大规模 AI 工厂设计,通过硬件加速的交换机和网卡协同设计,解决传统以太网在 AI 训练中的瓶颈。该架构采用自适应路由、硬件拥塞控制和平面负载均衡,在多租户场景下将训练步进时间稳定在 668 毫秒,而传统以太网在噪声流量下延迟至 1.18 秒。这显著提升了 AI 训练的性能和隔离性。
NVIDIA DSX MaxLPS:优化 AI 工厂每瓦性能
NVIDIA 发布了 DSX MaxLPS 技术套件,旨在提升 AI 工厂在固定电力预算下的吞吐量。该套件通过动态功率分配、软件优化和 45°C 温热水冷技术,将静态机架供电改为动态调度,可回收闲置功率并提升能效。其核心组件 Dynamic Power Software (DPS) 和 DSX Exchange 目前处于开发者预览阶段,有望显著提高 AI 数据中心的功率利用率。
NVIDIA BlueField-4 驱动 Scale-In 网络,加速代理式 AI 工厂基础设施
NVIDIA 推出第五大 AI 网络支柱 Scale-In,专为代理式 AI 工厂设计,由 BlueField-4 DPU、DOCA 软件和 Spectrum-X 以太网驱动,提供安全、多租户、高性能的数据访问和基础设施操作。该架构将南北向网络整合为统一加速域,减轻主机 CPU 负担,提升安全性和效率。BlueField-4 还支持 NVIDIA BlueField Astra 扩展控制平面,并与 CMX 协同管理 KV 缓存。
Haystack v3.1.0 发布:新增 Agent 上下文压缩与 PDF 链接解析
Haystack 发布了 v3.1.0 版本,包含多项升级说明和新功能。升级说明涉及序列化组件加载、Agent 状态键、评估器评分、管道快照格式等变更,要求用户调整代码。新功能包括为 PDF 组件添加链接解析参数,以及为 Agent 引入实验性的上下文压缩机制,通过 CompactionHook 和 SlidingWindowCompactor 策略在接近上下文窗口限制时缩短对话。
llama.cpp b10604 发布,新增 DeepSeek 4 张量并行支持
llama.cpp 发布 b10604 版本,主要新增对 DeepSeek 4 的 tensor 并行支持,包括共享专家延迟 allreduce 等优化。该版本提供多平台二进制文件,涵盖 macOS、Linux、Windows、Android 等,并支持多种硬件后端。
模型发布
MODEL RELEASE3 篇Whittle MoE 27B:从 Qwen3.8 裁剪的专家混合模型,路由器修复后性能恢复
Hugging Face 上发布了新模型 logic65/Qwen3.8-Whittle-MoE-27B-A17.8B,这是一个从 Qwen3.8-27B 后验裁剪出的混合专家模型,通过仅训练路由器恢复性能,并解决了循环生成问题。该模型在 24GB 显存下可运行,但结构化输出仍较弱,且评估规模有限。
SKT 发布 688B 参数 MoE 模型 A.X K2,支持原生 FP8 训练
SKT 发布了 A.X K2,这是一个 6880 亿参数、330 亿激活参数的 MoE 语言模型,作为 A.X K1 的继任者,支持思考与非思考模式,并采用 Think-Fusion 训练方法。该模型原生 FP8 训练,支持 256K 上下文,并针对多语言和代码进行了优化。它是韩国政府主权 AI 基础模型项目的一部分,旨在提升韩语和文化理解能力。
Ornith AI 发布 Ornith-1.5-35B-A3B 模型,以 3B 激活参数实现卓越编码性能
Ornith AI 发布了 Ornith-1.5-35B-A3B 模型,这是一个混合专家模型,每个 token 仅激活约 3B 参数。该模型通过端到端自我改进循环,联合优化任务生成、脚手架构建和解决方案生成,在编码和智能体基准测试中显著优于同尺寸的 Qwen 3.6-35B,并大幅超越 Gemma 4-31B 等密集模型。
研究进展
RESEARCH3 篇OraRL:将标注作为轨迹的高效可扩展视频多模态强化学习
南开大学等机构提出 OraRL,一种面向视频多模态大模型的高效强化学习后训练方法。该方法将标注作为 oracle 轨迹加入策略组,并设计解耦优势估计器避免优势反转,显著提升训练效率与性能。OraRL 在多项视频感知基准上超越现有模型,且推理速度大幅提升。
Vibe Coding 实践、性能、生产力与风险:最新综述
这篇综述论文系统梳理了“Vibe Coding”(AI辅助软件开发)的实践、性能、生产力和风险。研究发现早期基准测试已饱和,但任务级能力不均衡,如代码生成可靠而故障检测薄弱。生产力证据看似矛盾,但通过统一测量方法可解释,并指出收益在新代码上真实,在成熟代码库上可能缩小或逆转。
XPerf:面向代理式 AI 工作负载的 LLM 服务系统基准测试框架
XPerf 是一个用于对 LLM 服务系统进行代理式 AI 工作负载基准测试的框架,它通过细粒度轨迹重放来确保可复现性,并提供系统和硬件性能的详细剖析。该框架默认包含八个代理应用,支持从真实应用中收集轨迹、合成新工作负载,并可在不同服务系统上重放。实证研究表明,XPerf 能准确重放代理工作负载,帮助识别性能瓶颈,并辅助系统调试。XPerf 将在 GitHub 上开源。