VOL. 2026-09-09 · 12 STORIES · DAILY INTELLIGENCE
AI HOT RADAR 日报
2026-09-09 · PUBLISHED · 约 9 分钟
今日AI行业焦点集中在模型发布与基础设施升级
今日AI行业焦点集中在模型发布与基础设施升级。OpenAI 动作密集,既推出 ChatGPT Images 2.5 图像生成模型,又将 GPT-6 Astra 登陆 Amazon Bedrock 强化企业级应用,同时其未发布模型解决千禧年难题引发抢先发表争议。开源生态方面,vLLM v0.29.0 默认启用 MRV2 并新增多模型支持,Hugging Face Transformers v5.17.0 也扩展了多模态模型覆盖。硬件与效率优化成为另一主线,OpenBMB 发布首个昇腾原生 1.58 位三元大模型,AWS 推出 Ray Serve 深度学习容器替代 TorchServe,MiniMax-H3 Turbo LoRA 则通过压缩技术加速视频生成。研究领域,DeepMind 发布 AlphaGenome Atlas 绘制 90 亿种 DNA 变异图谱,MERIT 基准则揭示了工具型代理的记忆效用与风险。
今日看点
3 个章节 · 12 条情报- 01产品发布vLLM v0.29.0 发布:默认 MRV2,新增多模型支持与性能优化4
- 02模型发布OpenBMB 发布首个昇腾原生 1.58 位三元大模型 BitCPM-CANN5
- 03研究进展OpenAI用未发布模型解决千禧年难题,引发抢先发表争议3
产品发布
PRODUCT RELEASE4 篇vLLM v0.29.0 发布:默认 MRV2,新增多模型支持与性能优化
vLLM 发布 v0.29.0 版本,包含 594 个提交,来自 277 位贡献者。主要亮点包括 Model Runner V2 成为所有模型的默认执行器,新增多个模型支持(如 Hy4-preview、Qwen3.8-Flash-Next、GraniteSWA 等),并针对 Kimi K3 和 DeepSeek V4 进行了性能优化。此外,该版本引入了新的默认设置(如 FlashInfer 全归约默认启用)和多项破坏性变更(如移除十个弃用模型架构)。
Transformers v5.17.0 发布:新增 HYV4、VibeVoice 等模型支持
Hugging Face Transformers 库发布 v5.17.0 版本,新增多个模型支持,包括 HYV4、VibeVoice、NeoMME、Fun-ASR-Nano、KimiLinear 和 Canary。这些模型涵盖语言、语音、多模态等不同领域,并引入了多种创新架构。该版本扩展了 Transformers 的模型生态,为开发者提供了更多选择。
AWS 推出 Ray Serve 深度学习容器,简化 TorchServe 推理工作负载
AWS 发布了 Ray Serve 深度学习容器(DLC),用于替代不再维护的 TorchServe,提供预构建、优化的推理镜像。该容器集成了 PyTorch、Ray Serve、CUDA 等组件,并支持在 Amazon EKS 上部署视觉语言模型(如 Qwen3-VL-2B)。文章详细介绍了部署步骤和架构,旨在简化模型推理的依赖管理和安全补丁更新。
Mastra 发布高级追踪查询、租户级删除及 Factory 看板更新
Mastra 发布 2026 年 9 月 9 日更新,核心亮点包括:新增高级追踪查询契约及 ClickHouse、DuckDB、Postgres 实现;支持租户级追踪删除与级联清理;为工作流控制流块添加元数据;Agent 频道新增 onAction 处理器;Factory 自定义看板成为一等公民。同时包含多项破坏性变更,涉及 @mastra/factory 和 @mastra/playground-ui 的 API 调整。
模型发布
MODEL RELEASE5 篇OpenBMB 发布首个昇腾原生 1.58 位三元大模型 BitCPM-CANN
OpenBMB 发布了 BitCPM-CANN 模型系列,这是首个基于华为昇腾 NPU 原生训练的端到端 1.58 位三元大语言模型系统。该系统将量化感知训练集成到 Megatron-LM 框架中,并使用 MindSpeed 加速,在昇腾 910B 上训练了 0.5B 至 8B 四个模型。在 11 项基准测试中,1B/3B/8B 模型保留了全精度性能的 95.7%–97.2%,推理时内存减少约 6 倍,训练吞吐量仅下降 5%。模型采用伪量化格式,可直接使用标准 Transformers 库加载推理。
OpenAI 发布 ChatGPT Images 2.5:更快更精准,但体验因用户而异
OpenAI 发布了 ChatGPT Images 2.5 图像生成模型,包含 Flare 和 Sunburst 两个版本,分别面向速度和精度。新模型支持更精准的编辑、自然光照和纹理,并引入 Sketch 绘图工具和可分享提示词。API 定价与旧版一致,但新增了更高品质档位,且无批量折扣。测试显示,在 ChatGPT 的 Work 模式下编辑一致性较好,而 Chat 模式仍会改变无关细节。
GPT-6 Astra 登陆 Amazon Bedrock,强化企业级 AI 应用
OpenAI 的 GPT-6 Astra 模型已在 Amazon Bedrock 上正式可用,该模型具备更强的推理和判断能力,支持高达 100 万 token 的上下文窗口,并引入了显式和隐式提示缓存。它通过 OpenAI 的 Preparedness Framework 评估,成为首个达到网络安全能力 Critical 级别的模型,并集成了 AWS 的安全与治理控制。企业可通过 Bedrock API 直接调用,或配置 ChatGPT Work 和 Codex 使用,同时新增了针对企业应用的插件。
MiniMax-H3 Turbo LoRA 适配器发布,支持 ComfyUI 加速视频生成
drbaph 在 Hugging Face 发布了 MiniMax-H3 Turbo LoRA 适配器,专为 ComfyUI 优化,支持文本到视频和参考到视频生成。这些 LoRA 通过动态秩压缩技术,将模型大小减少最多 83%,同时保持高数值保真度,并加速推理步骤。该仓库包含多个版本的 LoRA 文件,并提供了详细的数值验证结果。
Suno发布v6音乐模型,与华纳等合作
Suno发布新一代v6音乐生成模型,与华纳音乐、BMG和Believe合作开发,提供三个版本,其中v6-mini免费。新模型支持多模态输入和文本指令编辑歌曲部分,但训练数据细节保密。华纳已和解,环球和索尼仍在起诉。
研究进展
RESEARCH3 篇OpenAI用未发布模型解决千禧年难题,引发抢先发表争议
OpenAI 使用未发布的模型解决了纳维-斯托克斯存在性与光滑性问题,这是七个千禧年大奖难题之一,奖金100万美元。NYU教授Tristan Buckmaster指控OpenAI在得知他和Anthropic同事Levent Alpöge的类似工作后才启动项目,存在抢先发表嫌疑。OpenAI否认访问用户数据,但承认无法排除去标识化数据对模型改进的影响。该事件引发关于AI研究伦理和数据隐私的讨论。
MERIT:成本感知的长期记忆评估揭示工具型代理的记忆效用与风险
MERIT 基准测试评估了工具使用型 LLM 代理中长期记忆的边际效用,通过 23,440 个带成本核算的片段发现,记忆可将依赖任务的成功率从 0 提升至 0.55-1.00,但嵌入检索在更新事实时表现不稳定,而结构化事实存储和 LLM 摘要等更新时写入的记忆更稳健。研究还表明,记忆实现的选择可导致任务成功率相差 60 个百分点,且完整重放不经济。该基准、测试框架及全部轨迹已开源。
DeepMind 发布 AlphaGenome Atlas,绘制人类基因组所有可能 DNA 变异图谱
Google DeepMind 发布了 AlphaGenome Atlas,这是一个包含人类基因组中约 90 亿种可能的单字母变异影响的预测数据集,规模达 1 PB,是 AlphaFold 数据库的 30 多倍。该图谱基于 2025 年推出的 AlphaGenome 模型,并提供了简化的变异影响评分(AVI),在非编码区变异致病性预测上优于现有工具。实际案例中,AVI 帮助诊断了一例严重癫痫患儿,并在回顾性研究中显著提高了致病变异的排名。该图谱通过网页门户、API 和 Google Antigravity 技能提供非商业用途,商业版本将随后推出。