VOL. 2026-09-02 · 10 STORIES · DAILY INTELLIGENCE
AI HOT RADAR 日报
2026-09-02 · PUBLISHED · 约 7 分钟
今日AI领域迎来多款重磅模型发布,Anthropic推出Claude…
今日AI领域迎来多款重磅模型发布,Anthropic推出Claude Fable/Mythos 5.1旗舰模型,虽缓存成本大幅下调但输出token用量增加导致单任务成本上升;Qwen团队发布首个面向自动驾驶的视觉语言基础模型Qwen-Drive-1.0,集成3D感知与运动规划能力。安全领域成为焦点,OpenAI将Astra评为最具网络攻击风险的模型,NVIDIA与CrowdStrike则联合推出SafeMind代理式网络安全系统。此外,谷歌发布集成于Workspace的AI图像编辑工具Google Pics,编码代理的harness工程研究揭示了行业设计模式,而Hugging Face的回放管道研究为生产环境安全替换LLM提供了新方法。
今日看点
3 个章节 · 10 条情报- 01模型发布Claude Fable/Mythos 5.1 发布:缓存降价但成本上升5
- 02产品发布谷歌推出Google Pics:集成于Workspace的AI图像编辑工具2
- 03研究进展编码代理的harness工程:11个系统的源码解剖与演进3
模型发布
MODEL RELEASE5 篇Claude Fable/Mythos 5.1 发布:缓存降价但成本上升
Anthropic 发布了 Claude Fable 5.1 和 Mythos 5.1,定位为编码和知识工作的新旗舰模型,宣称在多项基准上达到 SOTA。缓存读取价格下调 75%,但输出 token 使用量增加约 1.7 倍,导致单任务成本上升 20%。社区分析认为两个模型可能共享权重,仅安全策略不同。
Qwen-Drive-1.0:迈向自动驾驶视觉语言基础模型
Qwen团队发布Qwen-Drive-1.0,这是首个面向自动驾驶的视觉语言基础模型,基于Qwen3.5-4B架构,集成3D感知、视觉问答和运动规划。模型通过外部BEV感知头和规划专家模块,在保持通用视觉语言能力的同时实现驾驶场景理解。实验显示其在3D感知和规划性能上具有竞争力,并已开源模型权重和代码。
Qwen3.8-Flash-Next 推出 INT4 量化版,支持 Ampere GPU 运行
VnimanieAI 发布了 Qwen3.8-Flash-Next 的 INT4 量化版本,这是该模型首个公开的 INT4 量化,可在消费级 Ampere GPU(如 RTX 3090)上运行,而官方 FP8 版本不支持这些 GPU。量化采用 W4A16 格式,模型大小从 335GB 降至 168GB,通过 vLLM 部署,支持专家并行和 MTP 推测解码。该版本针对 Ampere GPU 优化,解决了 FP8 和 NVFP4 在旧硬件上的兼容性问题。
OpenAI 称 Astra 为最危险模型,安全监控面临挑战
OpenAI 将其即将推出的 Astra 模型评为首个具有“严重”网络攻击能力的系统,同时声称这是其构建的最安全模型。内部测试显示 Astra 在漏洞利用基准上表现优异,并发现了两个零日漏洞。为应对风险,OpenAI 计划推出新的安全措施,包括监控模型的思维链,但该技术可能因模型内部推理的不可见性而存在局限。
FunAudioLLM 发布 Fun-ASR-Nano 语音识别模型的 Transformers 版本
FunAudioLLM 发布了 Fun-ASR-Nano-2512-hf,这是其端到端语音识别模型的 Hugging Face Transformers 兼容版本,支持中文、英文和日文,其中中文覆盖 7 大方言区和 26 种地方口音。该模型基于数千万小时的真实语音数据训练,但此 Transformers 版本不包含 CTC 分支,因此不支持时间戳和说话人分离。模型集成正在通过 Hugging Face Transformers 的 PR 进行,用户需使用特定构建版本。
产品发布
PRODUCT RELEASE2 篇谷歌推出Google Pics:集成于Workspace的AI图像编辑工具
谷歌宣布推出基于Nano Banana图像生成与编辑模型的Google Pics工具,面向Google AI Pro和Ultra订阅用户及多数Workspace商业客户。该工具提供对象分割、图像内文本编辑与翻译、协作编辑及多版本生成等功能,并集成到Slides、Docs和Drive中,使用户无需切换应用即可完成图像创作与编辑。
NVIDIA与CrowdStrike联合推出SafeMind代理式网络安全系统
NVIDIA CEO黄仁勋在CrowdStrike Fal.Con 2026大会上宣布与CrowdStrike合作推出SafeMind,一个基于NVIDIA Nemotron模型构建的代理式网络安全系统。SafeMind通过攻防对抗的持续共进化循环,利用CrowdStrike的数据进行后训练,旨在提升防御效率并降低成本。此外,CrowdStrike还发布了Falcon IQ,以自动化代理工作负载。
研究进展
RESEARCH3 篇编码代理的harness工程:11个系统的源码解剖与演进
该论文对11个生产级编码代理的源码进行了系统解剖,定义了harness工程学科,并识别出7个子系统和29种设计模式。研究发现,所有系统均未使用通用代理框架或向量检索,而SKILL.md技能采用率超过MCP。论文指出,到2026年上半年,编码harness已从工具转变为平台,并提出了18条设计建议。
生产级 LLM 评估:用于安全模型替换的回放管道
Hugging Face 博客介绍了一个用于在对话代理中安全替换 LLM 的回放管道,该管道在生产环境下重放已批准的合成交互,仅将模型作为变量。评估了 8 个模型,其中 3 个获批,3 个因幻觉率超标被拒,但逐轮重新计算显示部分拒绝是统计平局或结构性问题。文章强调安全标准应作为独立过滤器,而非加权平均的一部分。
ZimaBlue:通过可扩展视频预训练进化通用世界动作模型
ZimaBlue 是一个从大规模视频中学习通用世界动作模型(WAM)的可扩展框架,采用三阶段训练课程:因果具身视频预训练、视频-动作中间训练和针对目标机器人的微调。其异步慢-快双系统架构支持在 RTX 4090 上实现 30 Hz 的实时动作预测。在真实机器人零样本评估中,将训练数据从仅目标机器人数据扩展到超过 12 万小时的具身视频,成功率从 36.1% 提升至 77.8%,并在多个基准上表现优异,尤其在未见任务上提升显著。