VOL. 2026-10-06 · 12 STORIES · DAILY INTELLIGENCE
AI HOT RADAR 日报
2026-10-06 · PUBLISHED · 约 10 分钟
当天最突出的变化是开放权重模型竞争进一步升温:Reflection …
当天最突出的变化是开放权重模型竞争进一步升温:Reflection 发布首个开放权重模型 Beam,采用混合专家架构、每 token 仅激活 230 亿参数,号称中国以外最强开放权重模型;同时 GLM 5.3 以 753B 参数上线 Amazon Bedrock,面向编程与长周期智能体任务。多模态生成也在推进,Kandinsky 6.0 Video 支持同步音视频生成,Hugging Face 则发布紧凑型机器人视觉语言动作模型 SmolVLA。研究侧聚焦智能体的训练与保障,包括可验证奖励强化学习对视频语言模型时间理解的影响、长程智能体的在线测试时训练,以及面向智能体保障的证据组织框架。合规方面,OpenAI 将在欧盟为 ChatGPT 文本添加隐形水印以符合 AI 法案要求。
今日看点
4 个章节 · 12 条情报- 01模型发布Reflection 发布 Beam:中国以外最强开放权重模型6
- 02研究进展可验证奖励教会视频语言模型时间吗?多模型对照研究4
- 03产品发布NVIDIA 推出 Green Contexts 实现 GPU 资源显式分区1
- 04政策与监管OpenAI 将在欧盟为 ChatGPT 文本加水印,API 用户可选1
模型发布
MODEL RELEASE6 篇Reflection 发布 Beam:中国以外最强开放权重模型
AI 初创公司 Reflection 发布其首个开放权重模型 Beam,面向编程、逻辑推理与智能体任务,采用混合专家架构,每 token 仅激活 5010 亿参数中的 230 亿,主打计算效率。Reflection 称 Beam 在关键推理基准上可匹敌 GLM 5.2,但计算量少三到四倍,并接近规模更大的 Qwen3.8-Max。该模型基于 10500 块 Nvidia GB300 GPU 进行四周强化学习训练,将于本月晚些时候以 Apache 2.0 许可证发布权重。
DiffuRefill-1B:1.08B 掩码扩散语言模型预训练中
Hugging Face 上出现一个名为 DiffuRefill-1B 的 1.08B 参数掩码扩散语言模型预训练检查点,目前训练约进行到一半(约 10 万步 / 20 万步,约 460 亿有效 token)。该模型采用置信度定向重填充解码,整段序列约需 20 次并行去噪即可生成,而自回归模型每 token 需一次前向。训练通过 DiLoCo 在 3-5 台单 GPU 机器上同步进行,作者称其英语流畅但事实性仍不可靠,尚未做指令微调。
Kandinsky 6.0 Video:同步音视频生成基础模型
Kandinsky 6.0 Video 是一系列用于同步文本到音视频生成的基础扩散模型,包含 3B 参数的 Lite 版和 29B 参数的 Pro 版,可生成 5 秒带 44 kHz 同步音频(含唇形同步)的视频,并支持 T2AV 与 I2AV 模式,内置超分辨率模型可将输出提升至 Full-HD。模型采用双流 CrossDiT 架构,通过双向交叉注意力连接预训练视频流与新训练音频流,并经过持续预训练、监督微调、强化学习后训练和蒸馏。人类评估显示 Pro 版明显优于 Kandinsky 5.0 Pro,在语音质量上与领先模型保持竞争力,且代码、权重和 Diffusers 集成以 MIT 许可开源。
Sopro V2 Turbo:120M 开源流式语音克隆 TTS 模型
开发者 samuel-vitorino 在 Hugging Face 发布开源 TTS 模型 sopro-v2-turbo,参数规模 120M,支持英语、欧洲葡萄牙语、法语和德语,具备零样本声音克隆与流式合成能力。该模型可在笔记本 CPU 或浏览器(ONNX 运行时)上运行,M3 CPU 上流式 RTF 为 0.21,H100 上为 0.07,首音频延迟约 300 毫秒。模型采用 Apache-2.0 许可,训练数据来自 Emilia YODAS、LibriTTS-R 和 FalAR,但作者暂不计划开源训练代码。
Hugging Face 发布 SmolVLA 紧凑型机器人视觉语言动作模型
Hugging Face 在 LeRobot 框架下发布 SmolVLA 基础模型(lerobot/smolvla_base),这是一个紧凑高效的视觉-语言-动作(VLA)模型,基于 SmolVLM2-500M-Video-Instruct,采用流匹配训练目标,可在单张 GPU 上训练并部署于消费级硬件。模型支持多视角图像、本体状态和可选语言指令输入,输出连续动作,定位为可微调的基础模型,性能可媲美更大的 VLA 模型。
GLM 5.3 上线 Amazon Bedrock
AWS 宣布 Z.ai(智谱 AI)的 GLM 5.3 模型正式上线 Amazon Bedrock,该模型为 753B 参数的混合专家模型,针对编程和长周期智能体任务优化。用户可通过完全托管的 OpenAI 兼容 API 调用,并支持跨区域推理、提示缓存和服务层级。Z.ai 报告该模型在 CyberGym 安全基准上取得 84.5 的领先分数,展现出新兴的网络安全能力。
研究进展
RESEARCH4 篇可验证奖励教会视频语言模型时间吗?多模型对照研究
该研究对四个开源视频语言模型(Qwen3-VL-8B/4B、Qwen2.5-VL-7B、Gemma-3-12B)使用GRPO进行可验证奖励强化学习(RLVR),对比了验证合成数据、未验证真实视频及混合三种数据配方。结果显示,验证奖励训练能大幅提升域内准确率,但其中相当一部分增益并非来自视觉感知,而是模型学到了答案先验和格式;仅用验证数据训练会严重损害域外真实视频性能(Qwen3-VL-8B下降26.7和25.2分),而混合真实视频数据可避免退化。研究还发现,没有任何配方能让模型真正学会利用帧序,即时间顺序接地能力未得到提升。
System-1 决策模型在 LLM Agent Harness 中的配对与自审计评估
该论文对两种 System-1 决策模型(开源 Laya 与托管 Jev)在 LLM Agent harness 的 11 个决策点上进行了配对评估,使用 18 个公开来源构建的 7,283 个基础案例和 6,640 个鲁棒性变体。结果显示 Jev 在 11 个决策点中的 9 个上显著更准确,但两者在零样本模型路由上均未超过随机水平,在 RAG 相关性门控上持平;Laya 对选项顺序敏感且在同质候选下性能骤降。作者还自我审计了评估流程,发现三处分析错误和一处设计混淆曾扭曲部署结论,例如实际节省仅 4.3% 而非报告的 23.9%。
为语言模型智能体保障组织轨迹证据:片段、方法与残差
该论文提出一种面向语言模型智能体保障的统一框架,用双层逻辑(外层有限轨迹时序逻辑、内层关于论证结构成立性的逻辑)与信息片段、保障账本组织来自规则检查器、支持检查器、前缀监控、执行门和稀有事件估计器等不同方法的证据。在456条电信轨迹上,基准预言机标记231条,加入规则检查器、支持替代和前缀监控基线后并集分别升至391、401、407条,各方法贡献了其他方法遗漏的标记,执行门使某条禁令在受控部署中变为精确。未被标记的49条轨迹及未满足或未处理的义务构成残差,需通过发现新需求并引入更强检查器来缩减。
ASCENT:通过验证经验自蒸馏实现长程智能体在线测试时训练
该论文提出 ASCENT 方法,用于长程 LLM 智能体的在线测试时训练(OaTTT):智能体在部署中每个任务只执行一次,仅凭该次轨迹及其验证结果作为学习信号。ASCENT 通过让冻结的初始模型副本以验证轨迹作为特权信息进行自蒸馏,将预测分布蒸馏进持久的 LoRA 快速权重,从而避免直接模仿或强化单次尝试导致的策略不稳定。在 ALFWorld、WebShop 和 AppWorld 上,ASCENT 随经验积累提升任务成功率与交互效率,超过在线适应方法,并可迁移到未见场景;在 ALFWorld 和 WebShop 上两种模型规模下精确成功率提升超过 22 个百分点。
产品发布
PRODUCT RELEASE1 篇NVIDIA 推出 Green Contexts 实现 GPU 资源显式分区
NVIDIA 在技术博客中介绍了 Green Contexts 功能,允许应用显式选择 GPU 执行资源子集并将工作定向到这些资源。该功能自 CUDA 12.4 起在 Driver API 中可用,CUDA 13.1 起通过 Runtime API 开放。它支持 SM 分区和 workqueue 资源分配,可减少多组件 GPU 应用间的资源竞争和意外串行化,且创建销毁轻量、不隐式同步无关工作。
政策与监管
POLICY1 篇OpenAI 将在欧盟为 ChatGPT 文本加水印,API 用户可选
OpenAI 将在欧盟为 ChatGPT 和 Codex 生成的文本添加名为 textGrain 的隐形水印,以符合欧盟 AI 法案对机器可读标注的要求,未来几周内上线。API 用户在全球范围内可选择开启水印,而 Anthropic 对 Claude 的水印则是强制性的。OpenAI 称水印不影响输出质量,但检测率受文本长度、主题和编辑影响较大,替换 25% 的词语即可将检测率降至 17%。检测器初期仅向部分研究者和专业机构开放申请。