VOL. 2026-08-13 · 12 STORIES · DAILY INTELLIGENCE

AI HOT RADAR 日报

新一期发布后,可按你的时区发送
REPORT DELIVERY

把报告送到邮箱

订阅整期 AI 行业简报,不会逐条发送动态。我们会先发送确认链接,未经确认不会投递。

  1. 1发送确认邮件链接 24 小时有效
  2. 2你点击确认防止他人冒用邮箱
  3. 3投递下一期报告含摘要、在线原文与退订链接
推送周期

按 Asia/Shanghai 当地时间 08:30 后投递已发布的下一期报告;不会补发确认前的历史期刊, 可随时从邮件退订。

今日看点

今日AI领域最显著的变化是多家机构密集发布模型与工具,其中Red H…

今日AI领域最显著的变化是多家机构密集发布模型与工具,其中Red Hat连续推出三款量化模型(Qwen3.6-35B-A3B的NVFP4和FP8版本、Gemma 4 12B的NVFP4版本),聚焦于通过量化技术提升推理效率。同时,SpaceXAI发布Grok 4.6,在多项基准上超越竞品且价格更低,并推出Grok Bot智能体产品,标志着商业模型竞争进入性能与价格双重比拼阶段。在开源生态方面,Hugging Face发布Luth-2法语小模型和North Micro Vision视觉语言模型,分别通过MOPD技术和原生分辨率设计刷新小尺寸模型基准。研究层面,TRACES基准和OpenART框架分别从科学推理可靠性和智能体红队测试角度揭示了大模型在认知安全上的短板,而GraphAlignCoder则通过图对齐方法提升了代码生成能力。此外,NVIDIA在GB300 NVL72上支持Qwen3.8-2.4T-A95B部署,以及llama.cpp新增SYCL ESIMD内核,共同推动了大规模模型在硬件和推理框架上的落地优化。

今日看点

3 个章节 · 12 条情报
  1. 01
    模型发布Red Hat 发布 Qwen3.6-35B-A3B 的 NVFP4 量化版本
    6
  2. 02
    研究进展穷人的智能体建模:在笔记本电脑上模拟大型LLM智能体社会
    4
  3. 03
    产品发布llama.cpp b10408 发布:新增 SYCL ESIMD Q3_K 内核
    2
01

模型发布

MODEL RELEASE6 篇

Red Hat 发布 Qwen3.6-35B-A3B 的 NVFP4 量化版本

Red Hat 发布了基于 Qwen3.6-35B-A3B 的 NVFP4 量化版本模型 RedHatAI/Qwen3.6-35B-A3B-NVFP4,权重和激活均量化为 NVFP4 格式,使用 llm-compressor 工具生成。该模型针对推理和工具调用优化,支持 vLLM 部署,并在多个基准测试中保持了接近原始模型的性能,如 GSM8K 和 GPQA 上恢复率超过 100%。

阅读原文 ↗

Red Hat 发布 Gemma 4 12B NVFP4 量化模型

Red Hat 发布了基于 Google Gemma 4 12B 指令模型的 NVFP4 量化版本,权重和激活均量化为 4 位浮点格式,使用 vLLM 的 llm-compressor 工具和 GPTQ 方法。该模型在 GSM8K 和 Wikitext 基准上进行了评估,性能接近 BF16 基线,并已在 RHOAI 3.5 和 vLLM 0.24.0 上验证。

阅读原文 ↗

Hugging Face 发布 Luth-2 法语小模型,采用 MOPD 技术刷新多项基准

Hugging Face 发布了 Luth-2-0.8B 和 Luth-2-2B 两个法语小语言模型,基于 Qwen3.5 后训练,采用多域策略蒸馏(MOPD)技术,在数学、代码、指令跟随、通用知识和工具调用等基准上刷新了同尺寸模型的最优成绩,性能可与两到三倍大小的模型竞争。模型、数据、代码和评估方法均已开源。

阅读原文 ↗

Red Hat 发布 Qwen3.6-35B-A3B-FP8 量化模型

Red Hat 发布了 Qwen3.6-35B-A3B 的 FP8 量化版本,该模型基于 Qwen 3.6 35B 架构,采用细粒度 FP8 量化(块大小 128),性能与原始模型几乎一致。模型支持工具调用和推理,上下文长度原生 262,144 令牌,可扩展至 1,010,000 令牌,并已在 RHOAI 3.5、RHAIIS 3.5 和 vLLM 0.24.0 上验证。该版本旨在提升编码代理和前端工作流的性能,同时保留推理上下文以优化迭代开发。

阅读原文 ↗

Cohere 发布 2.4B 原生分辨率视觉语言模型 North Micro Vision

Cohere 发布了 North-Micro-Vision-Instruct,一个 2.4B 参数的开源视觉语言模型,支持原生分辨率图像输入,采用 Apache 2.0 许可证。该模型结合了 400M 参数的视觉编码器和 2B 参数的语言模型,通过四阶段训练优化了文档理解、多语言视觉理解等能力。模型旨在支持边缘设备和移动端部署,并可通过微调适应特定领域。

阅读原文 ↗
02

研究进展

RESEARCH4 篇

穷人的智能体建模:在笔记本电脑上模拟大型LLM智能体社会

该论文提出一种在笔记本电脑上模拟大规模LLM智能体社会的方法,通过用低参数代理模型替代每个LLM智能体,这些代理模型从数百到数千次廉价查询中拟合而来。研究引入了一个交互顺序×记忆的分类法,用于预测替代误差的N趋势,并在EconAgent等八个LLM模拟中验证了该方法的有效性。

阅读原文 ↗

TRACES基准:评估大语言模型科学推理的认知可靠性

TRACES 基准测试通过 42 篇撤稿、欺诈或伪科学论文,评估大语言模型在科学推理中的认知可靠性。测试发现,30 个模型在 71% 以上的智能体探针中失败,22 个模型失败率超过 90%,表明模型拒绝不可靠前提的能力主要基于主题安全行为而非真正的认知能力。该研究呼吁为科学部署的语言模型建立防护基础设施。

阅读原文 ↗

OpenART:通过开放式环境演化扩展智能体红队测试

OpenART 是一个用于可扩展智能体红队测试的开放竞技场,通过环境演化来评估长周期 AI 智能体的安全性。它提供了超过 10,000 个跨 50 个领域的验证状态场景,并提出了 EMHA 攻击策略,该策略在无需参数更新的情况下实现了 85.0% 的总体攻击成功率。研究表明,随着任务复杂度的增加,环境演化能更有效地暴露安全失败,且智能体的运行时实现对其安全性的影响显著。

阅读原文 ↗

GraphAlignCoder:对齐程序与证明图以提升代码生成

GraphAlignCoder 是一种新的代码生成训练框架,通过将程序图与 Lean 证明图对齐,将显式的正确性结构注入代码生成。实验表明,相比 CodeRL,它在 LiveCodeBench v6 上解决数从 38 提升到 50,在 BigCodeBench Hard 上从 16 提升到 23,相对提升 31.6% 和 43.8%。该框架通过结构注入和巩固两个阶段,显著提升了代码生成的正确性。

阅读原文 ↗
03

产品发布

PRODUCT RELEASE2 篇

llama.cpp b10408 发布:新增 SYCL ESIMD Q3_K 内核

llama.cpp 发布 b10408 版本,主要新增了 SYCL 后端下的 DMMV Q3_K ESIMD 内核,并重构了 ESIMD 内核以共享代码,默认启用 ESIMD(若可用)。该版本提供了适用于 macOS、Linux、Windows、Android 等平台的多种二进制包,但部分构建(如 macOS KleidiAI、ROCm 等)被禁用。

阅读原文 ↗

NVIDIA 在 GB300 NVL72 上支持 Qwen3.8-2.4T-A95B 模型部署

阿里巴巴发布了其最大的开源权重模型 Qwen3.8-2.4T-A95B(Qwen3.8-Max),总参数达 2.4T,每个 token 激活 95B 参数,采用细粒度 MoE 架构和全注意力与线性注意力混合设计,支持百万 token 上下文。NVIDIA 宣布该模型可在 GB300 NVL72 平台上以 FP8 精度实现每 GPU 每秒超 4K tokens 的吞吐量,并通过 SGLang、vLLM、NVIDIA Dynamo 和 NIM 等推理栈提供部署支持。该模型专为智能体工作负载设计,内置推理控制选项,并可通过 NeMo AutoModel 进行微调。

阅读原文 ↗
12独立事件
11一手报道
8发布来源
≈8 min读完本期
逐条速览当天值得追踪的 AI 变化所有事实条目均可回到原始发布方核验
阅读周报 →
已发布总述由 deepseek-v4-flash 生成;条目来自已保存的精选与 Story,事实以原文为准。生成于 2026/8/14 23:28:15 · report-v3