VOL. 2026-08-13 · 11 STORIES · DAILY INTELLIGENCE

AI HOT RADAR 日报

新一期发布后,可按你的时区发送
REPORT DELIVERY

把报告送到邮箱

订阅整期 AI 行业简报,不会逐条发送动态。我们会先发送确认链接,未经确认不会投递。

  1. 1发送确认邮件链接 24 小时有效
  2. 2你点击确认防止他人冒用邮箱
  3. 3投递下一期报告含摘要、在线原文与退订链接
推送周期

Asia/Shanghai 当地时间 08:30 后投递已发布的下一期报告;不会补发确认前的历史期刊, 可随时从邮件退订。

今日看点

当日AI领域最显著的变化是多家机构密集发布量化与小型化模型,Red …

当日AI领域最显著的变化是多家机构密集发布量化与小型化模型,Red Hat 一口气推出三款基于 Qwen3.6 和 Gemma 4 的 NVFP4/FP8 量化版本,在保持性能的同时大幅降低部署门槛;Hugging Face 则发布法语小模型 Luth-2,通过多域策略蒸馏刷新同尺寸基准。与此同时,Grok 4.6 的发布在性能与价格上双双反超对手,并同步推出可自主操作工具的 Grok Bot,标志着商业模型竞争进入新阶段。在开源生态侧,阿里巴巴的 Qwen3.8-Max 获得 NVIDIA 官方支持,Cohere 也推出 2.4B 原生分辨率视觉语言模型,进一步丰富了开源模型矩阵。研究方面,低成本模拟大规模智能体社会的方法与智能体红队测试基准 TRACES 和 OpenART 的提出,反映出学界对智能体效率与安全性的双重关注。

今日看点

3 个章节 · 11 条情报
  1. 01
    研究进展穷人的智能体建模:在笔记本电脑上模拟大规模LLM智能体社会
    3
  2. 02
    模型发布Red Hat 发布 Qwen3.6-35B-A3B 的 NVFP4 量化版本
    6
  3. 03
    产品发布NVIDIA 在 GB300 NVL72 上支持 Qwen3.8-2.4T-A95B 模型部署
    2
01

研究进展

RESEARCH3

穷人的智能体建模:在笔记本电脑上模拟大规模LLM智能体社会

本文提出一种在笔记本电脑上模拟大规模LLM智能体社会的低成本方法,用低参数代理模型替代昂贵的大模型智能体,并引入交互顺序记忆分类法预测替代误差趋势。作者在EconAgent等八个LLM模拟上验证了该方法,发现EconAgent对奥肯定律的复现实为会计恒等式,而菲利普斯曲线才是真正的行为特征。该方法使宏观模拟成本大幅降低,并揭示了推理步骤而非提示词措辞是涌现宏观规律的原因。

查看事件脉络阅读原文 ↗

TRACES基准:评估大语言模型科学推理的认知可靠性

TRACES 基准测试通过 42 篇撤稿、欺诈或伪科学论文,评估大语言模型在科学推理中的认知可靠性。测试发现,30 个模型在 71% 以上的智能体探针中失败,22 个模型失败率超过 90%,表明模型拒绝不可靠前提的能力主要基于主题安全行为而非真正的认知能力。该研究呼吁为科学部署的语言模型建立防护基础设施。

查看事件脉络阅读原文 ↗

OpenART:通过开放式环境演化扩展智能体红队测试

OpenART 是一个用于可扩展智能体红队测试的开放竞技场,通过环境演化来评估长周期 AI 智能体的安全性。它提供了超过 10,000 个跨 50 个领域的验证状态场景,并提出了 EMHA 攻击策略,该策略在无需参数更新的情况下实现了 85.0% 的总体攻击成功率。研究表明,随着任务复杂度的增加,环境演化能更有效地暴露安全失败,且智能体的运行时实现对其安全性的影响显著。

查看事件脉络阅读原文 ↗
02

模型发布

MODEL RELEASE6

Red Hat 发布 Qwen3.6-35B-A3B 的 NVFP4 量化版本

Red Hat 发布了基于 Qwen3.6-35B-A3B 的 NVFP4 量化版本模型 RedHatAI/Qwen3.6-35B-A3B-NVFP4,权重和激活均量化为 NVFP4 格式,使用 llm-compressor 工具生成。该模型针对推理和工具调用优化,支持 vLLM 部署,并在多个基准测试中保持了接近原始模型的性能,如 GSM8K 和 GPQA 上恢复率超过 100%。

查看事件脉络阅读原文 ↗

Red Hat 发布 Gemma 4 12B NVFP4 量化模型

Red Hat 发布了基于 Google Gemma 4 12B 指令模型的 NVFP4 量化版本,权重和激活均量化为 4 位浮点格式,使用 vLLM 的 llm-compressor 工具和 GPTQ 方法。该模型在 GSM8K 和 Wikitext 基准上进行了评估,性能接近 BF16 基线,并已在 RHOAI 3.5 和 vLLM 0.24.0 上验证。

查看事件脉络阅读原文 ↗

Hugging Face 发布 Luth-2 法语小模型,采用 MOPD 技术刷新多项基准

Hugging Face 发布了 Luth-2-0.8B 和 Luth-2-2B 两个法语小语言模型,基于 Qwen3.5 后训练,采用多域策略蒸馏(MOPD)技术,在数学、代码、指令跟随、通用知识和工具调用等基准上刷新了同尺寸模型的最优成绩,性能可与两到三倍大小的模型竞争。模型、数据、代码和评估方法均已开源。

查看事件脉络阅读原文 ↗

Red Hat 发布 Qwen3.6-35B-A3B-FP8 量化模型

Red Hat 发布了 Qwen3.6-35B-A3B 的 FP8 量化版本,该模型基于 Qwen 3.6 35B 架构,采用细粒度 FP8 量化(块大小 128),性能与原始模型几乎一致。模型支持工具调用和推理,上下文长度原生 262,144 令牌,可扩展至 1,010,000 令牌,并已在 RHOAI 3.5、RHAIIS 3.5 和 vLLM 0.24.0 上验证。该版本旨在提升编码代理和前端工作流的性能,同时保留推理上下文以优化迭代开发。

查看事件脉络阅读原文 ↗

Cohere 发布 2.4B 原生分辨率视觉语言模型 North Micro Vision

Cohere 发布了 North-Micro-Vision-Instruct,一个 2.4B 参数的开源视觉语言模型,支持原生分辨率图像输入,采用 Apache 2.0 许可证。该模型结合了 400M 参数的视觉编码器和 2B 参数的语言模型,通过四阶段训练优化了文档理解、多语言视觉理解等能力。模型旨在支持边缘设备和移动端部署,并可通过微调适应特定领域。

查看事件脉络阅读原文 ↗
03

产品发布

PRODUCT RELEASE2

NVIDIA 在 GB300 NVL72 上支持 Qwen3.8-2.4T-A95B 模型部署

阿里巴巴发布了其最大的开源权重模型 Qwen3.8-2.4T-A95B(Qwen3.8-Max),总参数达 2.4T,每个 token 激活 95B 参数,采用细粒度 MoE 架构和全注意力与线性注意力混合设计,支持百万 token 上下文。NVIDIA 宣布该模型可在 GB300 NVL72 平台上以 FP8 精度实现每 GPU 每秒超 4K tokens 的吞吐量,并通过 SGLang、vLLM、NVIDIA Dynamo 和 NIM 等推理栈提供部署支持。该模型专为智能体工作负载设计,内置推理控制选项,并可通过 NeMo AutoModel 进行微调。

查看事件脉络阅读原文 ↗
11独立事件
10一手报道
8发布来源
8 min读完本期
逐条速览当天值得追踪的 AI 变化所有事实条目均可回到原始发布方核验
阅读周报
已发布总述由 deepseek-v4-flash 生成;条目来自已保存的精选与 Story,事实以原文为准。生成于 2026/8/13 21:46:15 · report-v3