VOL. 2026-10-08 · 9 STORIES · DAILY INTELLIGENCE
AI HOT RADAR 日报
2026-10-08 · PUBLISHED · 约 8 分钟
Anthropic 发布 Claude Haiku 5.5,定价对标…
Anthropic 发布 Claude Haiku 5.5,定价对标 OpenAI 的 GPT-6 Luna,并同步下调 Sonnet 5.5 价格、推出订阅用户 API 额度,Claude Code 也随即将其设为默认 Haiku 模型。OpenAI 则开始向 ChatGPT 免费和 Go 用户推送 GPT-6,以 GPT-6 Luna 替换 GPT-5.6 Luna,付费用户改用 GPT-6 Sol,并引入可生成图表与交互组件的 Intelligent UI。开源侧同样活跃,Qwen4 架构首个开放权重模型 Qwen3.8-Flash-Next 的 GGUF 量化版发布,另有 1.08B 掩码扩散语言模型 DiffuRefill-1B 与 4B 决策模型 Wald-Q4B v2 亮相。研究层面则聚焦推理与检索效率,包括针对 KV 缓存顺序遗忘的 KVFetch 预取方案、过程条件自一致性的 Route-Verify-Vote 框架,以及视觉文档检索中 VLM 教师监督信号的对比。
今日看点
3 个章节 · 9 条情报- 01模型发布Anthropic 发布 Claude Haiku 5.5,定价对标 GPT-6 Luna5
- 02研究进展KVFetch:为KV缓存压缩缺失的另一半提供时间预取3
- 03产品发布Claude Code 2.1.293 发布:新增 Haiku 5.5 模型并修复多项问题1
模型发布
MODEL RELEASE5 篇Anthropic 发布 Claude Haiku 5.5,定价对标 GPT-6 Luna
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 层级约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 对齐,同时下调 Sonnet 5.5 价格并推出订阅用户 API 额度。官方称其为最便宜、最快、最强的小模型,平均运行成本比 Haiku 4.5 低约 75%,定位为与 Opus 5.5 或 Sonnet 5.5 搭配的高并发子代理。第三方评测 Artificial Analysis 给出 Intelligence Index 43,略高于 GPT-6 Luna 的 38,但最大努力模式下输出 token 用量约为 Luna 的 3 倍。
DiffuRefill-1B:1.08B 掩码扩散语言模型预训练中
Hugging Face 上出现一个名为 DiffuRefill-1B 的 1.08B 参数掩码扩散语言模型预训练检查点,目前训练约进行到一半(约 10 万步 / 20 万步,约 460 亿有效 token)。该模型采用置信度定向重填充解码,整段序列约需 20 次并行去噪即可生成,而自回归模型每 token 需一次前向。训练通过 DiLoCo 在 3-5 台单 GPU 机器上同步进行,作者称其英语流畅但事实性仍不可靠,尚未做指令微调。
GPT-6今起免费推送:拒答变少,话变多了
OpenAI宣布GPT-6开始向ChatGPT免费和Go用户推送,用GPT-6 Luna替换此前的GPT-5.6 Luna,付费用户则使用GPT-6 Sol。新版ChatGPT引入Intelligent UI,可根据问题生成图表、按钮和交互工具,并支持边思考边呈现答案。同日OpenAI发布24页安全报告,显示GPT-6在网络安全、生物化学领域达到High门槛,多轮越狱防御和事实性有所提升,但在自伤、血腥、色情及未成年人相关评测中出现回退。
AtomicChat 发布 Qwen3.8-Flash-Next GGUF 量化版
AtomicChat 在 Hugging Face 发布了 Qwen3.8-Flash-Next 的 GGUF 量化版本,该模型是 Qwen4 架构的首个开放权重发布,拥有 177B 参数并支持多模态。其关键创新在于将 51B 参数以 n-gram 查找表形式存放在独立 GGUF 分片中,使 85GB 量化模型能在 64GB 内存的 M5 Max MacBook 上以 36 tok/s 运行。推荐使用 AD-4.27bpw-Q4_K_M 量化版本,在精度与体积间取得最佳平衡。
org2ai 发布开源 4B 决策模型 Wald-Q4B v2
org2ai 在 Hugging Face 发布开源决策模型 Wald-Q4B v2,基于 Qwen3.5-4B 微调,采用 Apache-2.0 许可。该模型接收状态与带类型的选项,直接输出每个选项的校准概率,用于工具选择、请求路由、分类等 agent 场景,可通过 Jev 兼容的 POST /v1/systemone API 在本地 GPU 部署。在 JevBench 公开集上取得 210/231,超过 Jev 1.13 的 200/231,并提供 GGUF 版本供 llama.cpp 使用。
研究进展
RESEARCH3 篇KVFetch:为KV缓存压缩缺失的另一半提供时间预取
该论文指出当前 KV cache 压缩方法(基于分数的驱逐、摘要补偿、卸载召回)都只实现了按内容关联的寻址,缺少按位置顺序遍历的寻址通道,导致在 RAG、代码补全等需要逐字复制标识符的任务中出现「顺序遗忘」失败。作者提出 KVFetch,一个免训练、即插即用的框架,通过将低可预测性字面量降级到量化冷层、用单调读指针检测复制行为、并预取位置后继到固定大小热层槽位,为任意基于分数的压缩器打开时间召回通道。在 RULER-16K 等预算控制下,逐字复制从 0.8 提升到 78.4,13 任务平均提升 +8.4,且在无需顺序访问的 LongBench 上无额外开销。
Route-Verify-Vote:面向混合域推理的过程条件自一致性
该论文提出 Route–Verify–Vote(RVV)框架,用于混合域推理中的过程条件自一致性,无需更新模型参数。RVV 通过域标签选择推理过程、逐选项验证约束,并对完整答案集投票,同时将额外采样分配给票数差距小的问题。在 SCoRE 2026 官方测试集上,16 次采样投票达到 74.6% 精确集合准确率,自适应 RVV 达 77.3%,结合模型后达 79.4%,最终系统排名第二。
VLM教师能传递什么?视觉文档检索监督信号对比
该研究比较了在视觉文档检索中如何利用VLM教师模型的不同监督信号。在固定学生模型、数据、优化器和评估的条件下,让教师判断挖掘出的困难负样本(N)和分数蒸馏(S)比丰富正样本的描述对齐(D)和注意力接地(A)更有效,将ViDoRe v2的nDCG@5从基线提升至更高水平。研究还发现训练集中的单正样本标签严重不完整,标注者认为查询前四名挖掘候选中约两个是相关的但未被标注,导致训练将相关页面当作负样本推开。作者发布了代码、教师判断、挖掘池、人工审计和训练适配器。
产品发布
PRODUCT RELEASE1 篇Claude Code 2.1.293 发布:新增 Haiku 5.5 模型并修复多项问题
Claude Code 发布 2.1.293 版本更新,新增 Claude Haiku 5.5 模型(claude-haiku-5-5)并成为 Anthropic API 上默认的 Haiku 模型,支持 100 万 token 上下文,定价为每百万 token 输入 0.10 美元、输出 0.50 美元(超过 10 万 token 的提示词为 0.50/2.50 美元)。同时为 subagentStatusLine 载荷增加 agentType 字段、为 $.tool.register 增加 isDeferred 选项,并修复了上下文压缩后 Claude 误判自身操作、HTTP MCP 连接内存泄漏、后台会话消息丢失、/model 努力级别越界、/tui 与 Chrome 连接、子代理工具禁用提示、claude.ai 同步技能描述未更新、登录过期导致登出、代理计数消失、Artifact 路径显示、/ultrareview 上传拒绝、远程控制流式输出与历史重复上传、插件测试与评估、权限绕过同意、vim 模式光标、Windows 进程误杀等大量问题,并回滚了 2.1.281 和 2.1.290 的两项改动,改进了 Team 和 Enterprise 组织的启动策略拉取。