VOL. 2026-08-28 · 12 STORIES · DAILY INTELLIGENCE

AI HOT RADAR 日报

新一期发布后,可按你的时区发送
REPORT DELIVERY

把报告送到邮箱

订阅整期 AI 行业简报,不会逐条发送动态。我们会先发送确认链接,未经确认不会投递。

  1. 1发送确认邮件链接 24 小时有效
  2. 2你点击确认防止他人冒用邮箱
  3. 3投递下一期报告含摘要、在线原文与退订链接
推送周期

Asia/Shanghai 当地时间 08:30 后投递已发布的下一期报告;不会补发确认前的历史期刊, 可随时从邮件退订。

今日看点

今日AI领域最突出的变化是模型压缩与效率优化成为焦点,Whittle…

今日AI领域最突出的变化是模型压缩与效率优化成为焦点,Whittle-MoE 27B通过后验裁剪和路由器训练修复性能,并发布v2.2量化版本改进停止信号,展示了在保持性能的同时降低计算成本的路径。与此同时,边缘AI部署和工具链加速推进,EdgeFirst发布Model Zoo提供真实硬件上的YOLO性能基准,Anthropic推出模型硬件标准预览以加速实验室自动化,DeepSpeed和RAGFlow等基础设施也迎来更新。研究方面,GeoRA为RLVR设计几何感知低秩适配获ACL 2026杰出论文,而证据感知检索评估和NeuronFuzz安全测试则揭示了现有方法在实用性和效率上的挑战。整体来看,行业正从模型能力竞赛转向部署效率、安全评估和多模态验证的精细化打磨。

今日看点

3 个章节 · 12 条情报
  1. 01
    模型发布Whittle-MoE 27B:从 Qwen3.8 裁剪的专家混合模型,路由器训练修复性能
    2
  2. 02
    产品发布EdgeFirst 发布 Model Zoo,提供真实硬件上的 YOLO 模型性能基准
    6
  3. 03
    研究进展GeoRA:为RLVR设计的几何感知低秩适配,获ACL 2026杰出论文
    4
01

模型发布

MODEL RELEASE2

Whittle-MoE 27B:从 Qwen3.8 裁剪的专家混合模型,路由器训练修复性能

Hugging Face 上发布了 Whittle-MoE-27B-A17.8B 模型,这是一个从 Qwen3.8-27B 后验裁剪出的混合专家模型,通过仅训练路由器参数恢复了性能,并引入了停止信号以减少重复输出。v2.2 版本将列表重复率降低 80%,对话终止率提升至 85%,但结构化输出仍较弱。模型以 Apache-2.0 许可发布,支持 GGUF 量化,可在 24GB VRAM 上运行。

查看事件脉络阅读原文 ↗

Whittle MoE 27B v2.2 GGUF 发布:改进停止信号与量化选项

Hugging Face 发布了 logic65/Qwen3.8-Whittle-MoE-27B-A17.8B-GGUF,这是从 Qwen3.8-27B 中提取的 MoE 模型的量化版本,v2.2 更新通过训练停止信号改善了列表终止和对话终止率,但精确计数有所下降。该模型支持多种量化级别,包括动态 DQ 系列,并提供了 CPU offload 和视觉投影仪选项。

查看事件脉络阅读原文 ↗
02

产品发布

PRODUCT RELEASE6

Google AI Mode 新增航班价格追踪、积分兑换和酒店预订功能

Google 在 AI Mode 中推出三项旅行规划新功能:航班价格追踪、积分/里程兑换查询以及酒店预订。用户可在对话中设置价格提醒,查看合作伙伴的积分兑换信息,并通过 Google Pay 完成酒店预订。这些功能已在全球或美国逐步上线,支持多家航空公司、酒店集团和预订平台。

查看事件脉络阅读原文 ↗

Anthropic 发布模型硬件标准预览,加速 AI 驱动实验室自动化

Anthropic 与 HHMI Janelia 研究园区合作,发布了模型硬件标准(MHS)的研究预览版,旨在让 AI 代理安全操作物理设备。MHS 通过标准化驱动和自然语言标签,将设备集成时间从数周缩短至数分钟,并支持多设备并行操作。该标准已提供给首批科研实验室和制造商,未来将开源。

查看事件脉络阅读原文 ↗

DeepSpeed v0.19.6 补丁发布:修复与 Apple Silicon 支持

DeepSpeed 发布了 v0.19.6 补丁版本,包含多项修复和功能改进,如修复 Ulysses 序列并行中的检查点选择、ZeRO-3 冻结参数问题,并新增对 Apple Silicon (MPS) 的支持(包括 Metal FusedAdam 内核)。此外,还实现了可配置的梯度求和归约、原生主机内存固定后端,以及 AutoTP 的不均匀分片和通用检查点支持。这些更新提升了 DeepSpeed 在多种硬件和场景下的稳定性和性能。

查看事件脉络阅读原文 ↗

RAGFlow v0.27.1 发布:新增连接器与搜索提供商,修复多项问题

RAGFlow 发布 v0.27.1 版本,新增 Azure DevOps 数据源连接器、You.com 和 Serply 网络搜索提供商,以及 Synthorai 模型提供商,并补充了 DeepSeek 模型。该版本改进了检索 API,暴露 rerank_candidates_count 等参数,并将元数据过滤下推到索引层以加速检索。同时修复了多项 bug,包括 PDF 解析失败、聊天自动滚动问题等。

查看事件脉络阅读原文 ↗
03

研究进展

RESEARCH4

GeoRA:为RLVR设计的几何感知低秩适配,获ACL 2026杰出论文

美团履约技术团队与北京大学联合提出了GeoRA,一种专为RLVR设计的低秩适配方法,通过谱先验和欧氏先验定位RLVR偏好的稀疏更新区域,再用SVD压缩为低秩适配器。实验表明,GeoRA在1.5B到32B的Qwen和Llama模型上,于数学、医学、代码等RLVR任务中稳定优于LoRA、PiSSA等基线,且训练参数降低99.5%,显存降低28.5%。该工作被ACL 2026接收为杰出论文,并已在美团AI骑手招聘场景中落地,效果与全参训练相当,相比LoRA提升约12%。

查看事件脉络阅读原文 ↗

证据感知检索在RAG中的下游效用评估

本研究评估了RAG中证据感知检索评估的下游效用,发现其虽能改变检索排名,但在训练、系统选择及答案质量预测上并不稳定。人类注释确认过滤保留了证据,但不同评估器对答案质量改善结论不一,凸显了评估信号有效性的组合问题。

查看事件脉络阅读原文 ↗

NeuronFuzz:利用安全神经元引导模糊测试评估大语言模型安全性

NeuronFuzz 提出了一种白盒模糊测试框架,利用模型内部安全神经元的激活作为连续反馈,用于评估大语言模型的安全性。该方法通过 SafetyOracle 在预填充阶段计算安全警报分数,避免了响应生成,从而提高了测试效率。实验显示,在五个白盒源模型上,NeuronFuzz 的越狱发现率达 76-100%,优于基线最多 48 个百分点,且优化模板可零样本迁移至开源和专有模型。

查看事件脉络阅读原文 ↗

模态成熟度指数:评估全模态模型多模态能力的基准

arXiv 论文提出 Modality Maturity Index (MMI) 基准,用于评估全模态模型在文本、图像、音频、视频和文档五种模态及其组合上的输入输出能力。MMI 包含 893 个问题,并引入 Modality Presence Score (MPS) 衡量模态生成能力。测试五个前沿模型发现 MPS 仅 15.6 至 34.9,表明现有模型多模态能力严重不足。

查看事件脉络阅读原文 ↗
12独立事件
12一手报道
11发布来源
8 min读完本期
逐条速览当天值得追踪的 AI 变化所有事实条目均可回到原始发布方核验
阅读周报
已发布总述由 deepseek-v4-flash 生成;条目来自已保存的精选与 Story,事实以原文为准。生成于 2026/8/28 21:12:31 · report-v3