VOL. 2026-08-11 · 9 STORIES · DAILY INTELLIGENCE
AI HOT RADAR 日报
2026-08-11 · PUBLISHED · 约 7 分钟
今日AI行业焦点集中在代理式AI的效率与治理上
今日AI行业焦点集中在代理式AI的效率与治理上。NVIDIA 发布 Nemotron 3.5 Lightning 和 NeMo Switchyard,前者以30B参数、3B活跃参数的MoE架构提升长时AI代理执行速度,后者提供跨模型路由以平衡成本与准确性。Meta 则通过 Muse Glimmer 和 Spark 重申个人超级智能愿景,重返开放权重前沿。基础设施层面,Cloudflare Agents Week 推出多项代理工具,AWS 发布 Claude 应用网关参考架构以强化企业治理,vLLM v0.27.0 与 OpenAI Agents JS v0.15.0 也分别带来模型支持与协议升级。研究方面,Hugging Face 的 Steerling-8B 探索将可解释性作为训练约束,展示了规模化下的新路径。
今日看点
3 个章节 · 9 条情报- 01模型发布NVIDIA 发布 Nemotron 3.5 Lightning:为长时 AI 代理提供快速精准执行3
- 02产品发布Cloudflare Agents Week 发布多项代理相关产品与工具5
- 03研究进展可解释语言模型的规模化:Steerling-8B 实现训练内可解释性1
模型发布
MODEL RELEASE3 篇NVIDIA 发布 Nemotron 3.5 Lightning:为长时 AI 代理提供快速精准执行
NVIDIA 发布了 Nemotron 3.5 Lightning,一个 30B 参数的 MoE 模型,仅有 3B 活跃参数,专为长时间运行的 AI 代理的高频执行任务设计。该模型支持 OpenClaw 和 Hermes Agent 等框架,并配合 NVIDIA NeMo Switchyard 进行模型路由,以及 NeMoClaw 安全与管理栈。Nemotron 3.5 Lightning 在速度和准确性上达到 Pareto 前沿,输出速度比同类模型快 4 倍,在 PinchBench 上以 86% 的准确率比 Qwen3.6 35B 快 30%。模型权重、训练数据和配方以 OpenMDW-1.1 许可发布,支持微调和强化学习。
Meta 发布 Muse Glimmer 与 Spark,重申个人超级智能愿景
Meta 在扎克伯格发表个人超级智能文章一周年之际,发布了开放权重模型 Muse Glimmer,并计划推出 Spark,标志着其重返开放权重前沿。扎克伯格在文章中阐述了 Meta 以个人超级智能为核心的战略,并提出了关于就业、基础设施、安全、美国领导力等风险与应对建议。Glimmer 模型可在单张 RTX 3090 上运行,被视为美国开放模型的一次胜利。
NVIDIA 发布 Nemotron 3.5 Lightning 和 NeMo Switchyard,提升代理式 AI 效率
NVIDIA 发布了 Nemotron 3.5 Lightning,一个 300 亿参数的混合专家模型,专为长时间运行的代理式 AI 工作负载设计,提供高达 4 倍的输出速度和 30% 更快的任务完成速度。同时,NVIDIA 推出了 NeMo Switchyard,一个开源模型路由库,可智能地将请求路由到最合适的模型,降低成本并保持质量。这些发布旨在为企业提供对 AI 部署和运行的更大控制,并已获得多家合作伙伴的采用。
产品发布
PRODUCT RELEASE5 篇Cloudflare Agents Week 发布多项代理相关产品与工具
Cloudflare 在 Agents Week 期间发布了一系列面向 AI 代理的产品和工具,包括新的代理运行时 @cloudflare/computer、Cloudflare Agents 平台、Cloudflare Wallets、WebMCP 接口、Kitesurf 浏览器以及 MCPv2 协议。这些发布旨在构建一个开放、安全的 Agentic Internet,支持代理的构建、部署、安全访问和交易。
AWS 发布 Claude 应用网关企业部署参考架构
AWS 发布了一篇关于部署 Anthropic Claude 应用网关(Claude apps gateway)的博客,该网关为 Claude Code 和 Claude Desktop 提供集中治理层,支持身份验证、模型访问控制、成本归属和支出限制。参考部署使用 AWS Fargate、RDS PostgreSQL、内部负载均衡器和 OIDC 身份提供商,确保企业级安全性和可扩展性。该网关解决了身份、策略、成本等治理需求,并支持与 Amazon Bedrock 或 Claude Platform 集成。
vLLM v0.27.0 发布:支持 Kimi K3、Qwen3.5,性能大幅提升
vLLM 发布 v0.27.0 版本,包含 561 个提交,来自 242 位贡献者。该版本新增对 Kimi K3、Qwen3.5、K-EXAONE-2.0 等模型的支持,并升级至 PyTorch 2.13.0,深化 FlashAttention 4 集成,优化 DeepSeek-V4 性能,扩展 Model Runner V2 至非生成任务,并引入容错框架和 Rust 前端 gRPC 控制平面。
NVIDIA NeMo Switchyard:跨模型路由 AI 代理工作负载
NVIDIA 发布了 NeMo Switchyard,这是一个用于 AI 代理工作负载的模型路由库,允许开发者根据任务需求在多个模型之间路由请求,以平衡准确性、成本和延迟。该库支持多种路由算法,并提供与提供商无关的 SDK 和服务器参考实现,可接受 OpenAI、Anthropic 等 API 请求。通过智能路由,系统可以在复杂任务中使用更强大的模型,在简单任务中使用较小模型,从而优化整体性能。
OpenAI Agents JS v0.15.0:默认模型更新与 MCP v2 支持
OpenAI Agents JavaScript 库发布 v0.15.0,默认模型改为 gpt-5.6-luna,并支持 MCP v2 协议协商。新版本增强了 RunState 的持久化能力,包括输入、工具输出和重试状态,同时改进了沙箱挂载凭据的安全性。此外,还增加了对 React Native 和 Realtime 的支持,并提升了 OpenAI 和 AI SDK 适配器的兼容性。
研究进展
RESEARCH1 篇可解释语言模型的规模化:Steerling-8B 实现训练内可解释性
Hugging Face 发布了一篇技术报告,提出将可解释性作为训练约束而非事后解释的方法。实验表明,在自回归和扩散语言模型中,可解释性随规模提升而增强。他们发布了 Steerling-8B 模型,该模型能归因输出到输入 token、概念和训练数据,支持闭环干预,且性能可与使用 2-16 倍计算量训练的模型竞争。