VOL. 2026-W37 · 11 STORIES · WEEKLY SIGNALS
AI HOT RADAR 周报
2026-09-07 — 2026-09-13 · PUBLISHED · 约 8 分钟
本周AI领域呈现两条清晰主线:一是搜索智能体与持续学习成为研究热点,…
本周AI领域呈现两条清晰主线:一是搜索智能体与持续学习成为研究热点,Iris提出端到端搜索智能体方法,字节跳动则发布EdgeBench基准衡量真实环境中的持续学习能力,并推出面向智能体场景的Seed2.1模型家族,多家厂商在推动智能体从实验室走向真实生产力。二是模型轻量化与端侧部署加速,Qwen3.8通过剪枝和INT4量化分别缩小体积,Nemotron-3-Nano-4B登陆Apple Core AI,llama.cpp新增Vulkan量化支持,显示行业正集中攻克高效推理。同时,OpenAI内部测试GPT-6 Sol,速度达Astra的6倍,并披露研究员人均使用3个AI Agent,预示AI辅助研发的范式正在形成。Claude Code连续迭代,新增Vertex AI向导与/fork等功能,并修复多项安全漏洞,反映出AI编程工具在功能扩展与安全加固上的同步推进。
本周主线
3 个章节 · 11 条情报- 01研究进展Iris:攀登搜索前沿的端到端搜索智能体方法3
- 02模型发布GPT-6 Sol内测曝光:速度是Astra的6倍,OpenAI研究员人均带3个AI实习生5
- 03产品发布llama.cpp b10831:Vulkan 新增 TQ1_0 支持,Metal 拒绝相关操作3
研究进展
RESEARCH3 篇Iris:攀登搜索前沿的端到端搜索智能体方法
本文提出了一种构建、训练和评估搜索智能体的端到端方法,并发布了Iris-mini和Iris-pro系统。该系统通过自动构造多跳任务、过滤训练数据、结合监督微调和强化学习进行迭代优化,在BrowseComp、DeepSearchQA等基准上取得了开源搜索智能体的最佳性能。研究还强调了上下文管理对搜索性能的重要影响,并提供了可测量的对比评估。
大语言模型中的证据整合机制研究
该研究提出了一种关于大语言模型(LLM)如何整合外部证据的分布理论,认为证据会通过接收者先验权重和候选证据倾斜来改变模型的初始答案分布。基于超过一千万次试验、十二个模型和八个领域的验证,研究发现模型更易接受自身倾向的候选,且相同证据可能提升弱模型而损害强模型。因果干预表明候选整合发生在网络后期,而验证表征对最终答案几乎没有因果影响。
EdgeBench:衡量真实环境学习并发现新扩展定律
字节跳动Seed Research发布了EdgeBench,一个超长时程基准,用于衡量智能体在真实环境中的持续学习能力,包含134个任务,每个任务支持至少12小时交互。研究发现,智能体的环境学习性能遵循log-sigmoid曲线,拟合优度R²=0.998,且前沿模型的学习速度约每三个月翻倍。EdgeBench已开源51个任务和完整评估框架,以促进社区研究。
模型发布
MODEL RELEASE5 篇GPT-6 Sol内测曝光:速度是Astra的6倍,OpenAI研究员人均带3个AI实习生
OpenAI正在内部测试GPT-6 Sol模型,其单次测试速度是刚发布的Astra的6倍,但输出能力较弱。同时,OpenAI披露内部数据显示,研究员人均使用3个AI Agent辅助工作,并宣布实现自动化AI研究实习生目标。首席科学家Jakub Pachocki发文呼吁行业减速,并警告AI监控难度加大。
Qwen3.8-Flash-Next 剪枝版:体积缩小28%,性能持平
Cyronius 发布了一个名为 Qwen3.8-Flash-Next-131B-A6B-GGUF 的模型,通过对 Qwen3.8-Flash-Next 的 n-gram 哈希嵌入表进行剪枝,将 GGUF 大小从 90GB 降至 64.8GB,同时保持工具调用、GSM8K 和 MMLU 基准性能不变。该模型无需训练或修改 transformer 架构,仅保留 16 个哈希头中的 2 个,利用多哈希冗余。尽管困惑度从 2.40 升至 4.66,但推理和工具使用能力未受影响。该模型兼容 llama.cpp 2026-08-27 或更新版本,并提供了完整的构建脚本和实验日志。
Nemotron-3-Nano-4B 登陆 Apple Core AI,实现高效端侧推理
mlboydaisuke 在 Hugging Face 上发布了 Nemotron-3-Nano-4B-CoreAI,这是 NVIDIA 的混合 Mamba-2/Transformer 模型在 Apple Core AI 运行时上的量化版本。该模型在 iPhone 17 Pro 上达到 16.0 tok/s 的解码速度,在 M4 Max 上达到 85.2 tok/s,且输出与 fp32 版本 token 级一致。此发布展示了 Core AI 作为 Core ML 的继任者,支持在 Apple 设备上高效运行混合架构模型。
Seed2.1正式发布:推动AI生产力提升
字节跳动旗下Seed研究团队正式发布Seed2.1模型家族,该系列面向智能体场景,旨在提升真实生产力。Seed2.1在通用智能体能力、端到端编码和多模态基础能力上均有增强,并在多个基准测试中表现优异。目前,豆包和火山引擎用户已可开始使用Doubao Seed 2.1。
Red Hat AI 发布 Qwen3.8-27B INT4 量化模型
Red Hat AI 发布了 Qwen3.8-27B 的 INT4 量化版本 RedHatAI/Qwen3.8-27B-INT4,基于 Qwen/Qwen3.8-27B 模型,使用 LLM Compressor 和 GPTQ/AWQ 技术进行量化,支持 vLLM 推理。该模型在多项评测中表现接近原始 BF16 模型,部分任务甚至略有提升,如 GSM8K 和 AIME25。
产品发布
PRODUCT RELEASE3 篇llama.cpp b10831:Vulkan 新增 TQ1_0 支持,Metal 拒绝相关操作
llama.cpp 发布 b10831 版本,为 Vulkan 后端新增 TQ1_0 量化格式支持,涵盖矩阵乘法、向量乘法、反量化及行获取等操作,并修复了独立反量化着色器中的错误。同时,Metal 后端明确拒绝 TQ1_0 的 GET_ROWS 和矩阵乘法操作,以避免因缺少内核而崩溃。该版本还优化了代码结构,提取共享解码辅助函数,并精简了注释。
Claude Code 2.1.98 发布:新增 Vertex AI 向导与安全修复
Claude Code 2.1.98 版本发布,新增 Google Vertex AI 设置向导、Perforce 模式、子进程沙箱、监控工具及多项权限修复。该版本修复了多个安全漏洞,包括 Bash 工具权限绕过和强制提示绕过问题,并改进了 MCP OAuth、LSP 和终端兼容性。
Claude Code 2.1.212 发布:新增 /fork 与资源限制,修复多项问题
Claude Code 发布 2.1.212 版本更新,新增 /fork 命令将对话复制到后台会话,并引入 auto-mode reset 命令及 WebSearch 和子代理的会话级限制。修复了多个 bug,包括计划模式自动运行文件修改命令、工作树符号链接问题、Windows 上后台任务失败等。改进了提示缓存、后台代理附加和网络搜索可靠性,并弃用 Task 工具的 mode 参数。