VOL. 2026-W33 · 19 STORIES · WEEKLY SIGNALS
AI HOT RADAR 周报
2026-08-10 — 2026-08-16 · PUBLISHED · 约 14 分钟
本周AI行业的主线是代理式AI的加速落地与多模态模型的密集发布
本周AI行业的主线是代理式AI的加速落地与多模态模型的密集发布。NVIDIA围绕Nemotron 3.5 Lightning连续发布多项更新,强调其在长时AI代理中的高效执行能力,并配套推出NeMo Switchyard与JetPack 7.2.1中的Agentic视频技能,形成从模型到平台的完整代理优化链路。Meta则通过Muse Glimmer重返开放权重前沿,并预告Spark,与NVIDIA在本地代理工作流上形成协同,同时Jina AI连续发布两款多模态嵌入模型,推动跨模态检索的标准化。在基础设施层面,vLLM v0.27.0大幅扩展模型支持并升级性能,Cloudflare Agents Week集中推出代理运行时与平台工具,而Anthropic宣布Claude Code默认自动模式,显示代理自主性正从技术验证走向产品化。研究方面,Google的AMIE升级至实时视频问诊,Hugging Face的Steerling-8B探索训练内可解释性,同时针对LLM API推理痕迹可互换的漏洞研究,揭示了专有模型在安全与蒸馏防护上的新挑战。整体来看,本周动态指向代理效率、多模态统一与开放权重三大趋势的交叉推进。
本周主线
3 个章节 · 19 条情报- 01模型发布NVIDIA 发布 Nemotron 3.5 Lightning:为长时 AI 代理提供快速精准执行10
- 02研究进展Google 推进 AMIE 实现专家级视听临床咨询5
- 03产品发布Cloudflare Agents Week 发布多项代理相关产品与工具4
模型发布
MODEL RELEASE10 篇NVIDIA 发布 Nemotron 3.5 Lightning:为长时 AI 代理提供快速精准执行
NVIDIA 发布了 Nemotron 3.5 Lightning,一个 30B 参数的 MoE 模型,仅有 3B 活跃参数,专为长时间运行的 AI 代理的高频执行任务设计。该模型支持 OpenClaw 和 Hermes Agent 等框架,并配合 NVIDIA NeMo Switchyard 进行模型路由,以及 NeMoClaw 安全与管理栈。Nemotron 3.5 Lightning 在速度和准确性上达到 Pareto 前沿,输出速度比同类模型快 4 倍,在 PinchBench 上以 86% 的准确率比 Qwen3.6 35B 快 30%。模型权重、训练数据和配方以 OpenMDW-1.1 许可发布,支持微调和强化学习。
Meta 发布 Muse Glimmer 与 Spark,重申个人超级智能愿景
Meta 在扎克伯格发表个人超级智能文章一周年之际,发布了开放权重模型 Muse Glimmer,并计划推出 Spark,标志着其重返开放权重前沿。扎克伯格在文章中阐述了 Meta 以个人超级智能为核心的战略,并提出了关于就业、基础设施、安全、美国领导力等风险与应对建议。Glimmer 模型可在单张 RTX 3090 上运行,被视为美国开放模型的一次胜利。
Jina AI 发布多模态嵌入模型 v5-omni-small
Jina AI 发布了 jina-embeddings-v5-omni-small,一个约 1.74B 参数的多模态嵌入模型,支持文本、图像、视频和音频输入,生成 1024 维共享向量空间嵌入,并与文本版 v5 模型对齐,无需重新索引即可跨模态检索。该模型支持检索、分类、聚类和文本匹配等任务,最大序列长度 32768,提供 Matryoshka 维度裁剪,并可通过 Elastic Inference Service 或 vLLM 部署。
NVIDIA 发布 Nemotron 3.5 Lightning 30B 混合架构模型
NVIDIA 发布了 Nemotron-3.5-Lightning-30B-A3B-NVFP4 模型,采用 MoE 架构,总参数 30B,激活参数 3B,支持长达 1M 的上下文,并针对单 GPU 部署优化。该模型支持多种硬件,并提供了 DSpark 等投机解码方法以加速生成。基准测试显示其在编码和智能体任务上表现良好,模型采用 OpenMDW-1.1 许可证,可商用。
Jina AI 发布多模态嵌入模型 v5-omni-small-retrieval
Jina AI 发布了 jina-embeddings-v5-omni-small-retrieval,这是一个多模态嵌入模型,支持文本、图像、视频和音频输入,并生成与文本模型对齐的共享向量空间。该模型约 1.56B 参数,嵌入维度 1024,支持最长 32768 序列,并可通过 Elastic Inference Service 或本地安装使用。该模型在图像、视频和音频基准上定义了开放权重前沿,旨在实现跨模态检索而无需重新索引。
NVIDIA 发布 Nemotron 3.5 Lightning 和 NeMo Switchyard,提升代理式 AI 效率
NVIDIA 发布了 Nemotron 3.5 Lightning,一个 300 亿参数的混合专家模型,专为长时间运行的代理式 AI 工作负载设计,提供高达 4 倍的输出速度和 30% 更快的任务完成速度。同时,NVIDIA 推出了 NeMo Switchyard,一个开源模型路由库,可智能地将请求路由到最合适的模型,降低成本并保持质量。这些发布旨在为企业提供对 AI 部署和运行的更大控制,并已获得多家合作伙伴的采用。
Meta 发布 Muse Glimmer:开源多模态模型,支持图像视频与工具调用
Meta 发布了 Muse Glimmer,一个 30B 参数的开源多模态模型,包含 2B 视觉编码器和 28B 文本解码器,支持图像、视频和工具调用。该模型在 transformers、llama.cpp、vLLM 等库中获得首发支持,并采用混合注意力、门控分组查询注意力等架构优化。Muse Glimmer 还提供了可选的投机解码模块,以加速生成。
NVIDIA 发布 Magpie 多语言 TTS:开源权重,低延迟部署
NVIDIA 发布 Magpie 多语言 TTS 模型,新增阿拉伯语、韩语和巴西葡萄牙语支持,共支持 12 种语言。该模型为 3.64 亿参数的开源权重模型,可通过 NVIDIA NIM 部署,在 B200 GPU 上实现 32 毫秒的首音频延迟和 320 倍实时吞吐。通过帧堆叠和局部 Transformer 架构优化,在保持语音质量的同时降低推理延迟,适用于多语言语音代理等场景。
Nanbeige4.2-3B GGUF 量化版本发布
gkraker04 发布了 Nanbeige4.2-3B 模型的 GGUF 量化版本,该模型基于 Looped Transformer 架构,专为 buun-llama-cpp 运行时设计。量化使用重要性矩阵引导,提供从 Q8_0 到 IQ2_XS 的多种精度,并附有 MMLU-Pro 和 MuSR 基准测试结果,显示 Q4_K_M 在质量与体积间达到最佳平衡。
Meta 发布 Muse Glimmer 模型,NVIDIA 平台支持本地代理工作流
Meta 发布了 Muse Glimmer,一个 30B 参数的开源稠密模型,支持 120K+ 上下文窗口,专为本地 AI 代理工作流设计。该模型在 NVIDIA 的 GPU 平台上优化运行,单 GPU 可实现每秒 20K tokens 的吞吐量,支持全本地推理,无需模型分片或外部端点。NVIDIA 提供了多种部署选项,包括 GeForce RTX 5090、DGX Spark、DGX Station 和 Jetson,并支持通过 NIM 容器、SGLang、vLLM 等推理栈进行部署和微调。
研究进展
RESEARCH5 篇Google 推进 AMIE 实现专家级视听临床咨询
Google Research 在博客中宣布其医疗 AI 系统 AMIE 升级为支持实时视频问诊的 AMIE (Video),基于 Gemini 和 Project Astra 构建,采用异步多智能体架构以平衡对话速度与深度推理。在包含 100 个场景、300 次实时咨询和 30 名认证医生的随机对照研究中,AMIE (Video) 首次展示了专家级表现,并开发了临床视听能力分类和自动化评估套件。该研究旨在提升远程医疗的可及性和诊断准确性。
窃取专有LLM API的推理痕迹
研究人员发现,Anthropic、OpenAI 和 Google 等大型语言模型提供商返回给客户端的加密推理痕迹块在不同会话、用户和模型间可互换,存在架构漏洞。通过将该痕迹注入同一提供商的较弱模型中,可强制其解码并输出明文,从而绕过反蒸馏机制,实现私有数据提取、隐藏危险信息泄露和隐形提示注入。研究团队从公共仓库中解码了 315,320 个推理块,恢复了 367 个个人身份信息和 182 个凭据,并提出了加密和系统级缓解措施。
可解释语言模型的规模化:Steerling-8B 实现训练内可解释性
Hugging Face 发布了一篇技术报告,提出将可解释性作为训练约束而非事后解释的方法。实验表明,在自回归和扩散语言模型中,可解释性随规模提升而增强。他们发布了 Steerling-8B 模型,该模型能归因输出到输入 token、概念和训练数据,支持闭环干预,且性能可与使用 2-16 倍计算量训练的模型竞争。
FineBooks:开源OCR模型能否解锁历史知识?
Hugging Face 与 EleutherAI 合作推出 FineBooks 项目,旨在评估开源 OCR 模型在处理历史文献上的表现,并重新处理公共领域书籍以提升 AI 训练数据质量。项目发布了包含 14 个模型的 BHL OCR 排行榜、基准数据集和评估工具,基于 2165 页专家转录的历史书籍页面进行测试。初步结果显示,现代 VLM 模型在历史文档上的准确率仍有提升空间,但成本较低,适合大规模应用。
AI人格会成长吗?分析并基准化LLM代理在生活事件后的人格演变
该研究分析了基于人格条件的大语言模型代理(PC-Agents)在经历11种重大生活事件后的人格演变,使用大五人格特质作为心理测量锚点。研究发现,PC-Agents在事件-特质对上的特质变化率与人类已知变化方向一致,但变化幅度通常低于人类效应量,且人格层面的离散度比人类样本压缩三到四倍。研究引入了可复用的基准BFI-Adapt,用于评分事件诱发人格变化的方向保真度,并对14个模型进行了排名。结果表明,当前PC-Agents能模拟人类人格动态的平均值,但无法模拟其分布形态。
产品发布
PRODUCT RELEASE4 篇Cloudflare Agents Week 发布多项代理相关产品与工具
Cloudflare 在 Agents Week 期间发布了一系列面向 AI 代理的产品和工具,包括新的代理运行时 @cloudflare/computer、Cloudflare Agents 平台、Cloudflare Wallets、WebMCP 接口、Kitesurf 浏览器以及 MCPv2 协议。这些发布旨在构建一个开放、安全的 Agentic Internet,支持代理的构建、部署、安全访问和交易。
NVIDIA JetPack 7.2.1 新增 Agentic 视频技能与 PyNvVideoCodec 支持
NVIDIA 发布 JetPack 7.2.1,首次在 Jetson 平台支持 PyNvVideoCodec 2.2,提供硬件加速视频编解码的 Python 接口,并引入基于 agent 的视频技能,帮助开发者自动配置、验证和基准测试编解码流程。该版本旨在加速 Jetson 上的 AI 应用开发,提升视频处理管线的效率和可复现性。
vLLM v0.27.0 发布:支持 Kimi K3、Qwen3.5,性能大幅提升
vLLM 发布 v0.27.0 版本,包含 561 个提交,来自 242 位贡献者。该版本新增对 Kimi K3、Qwen3.5、K-EXAONE-2.0 等模型的支持,并升级至 PyTorch 2.13.0,深化 FlashAttention 4 集成,优化 DeepSeek-V4 性能,扩展 Model Runner V2 至非生成任务,并引入容错框架和 Rust 前端 gRPC 控制平面。
Claude Code五天后默认自动模式,Anthropic承担额外成本
Anthropic宣布5天后所有Claude Code将默认启用自动模式,该模式通过分类器自动审批工具调用,额外token开销由Anthropic承担。数据显示人工审批的权限请求中97%被同意,而自动模式在对抗测试中拦截率更高,且不随会话长度下降。Anthropic还委托Apollo Research和Trajectory Labs进行安全测试,并公开了拦截案例。