VOL. 2026-08-22 · 12 STORIES · DAILY INTELLIGENCE

AI HOT RADAR 日报

新一期发布后,可按你的时区发送
REPORT DELIVERY

把报告送到邮箱

订阅整期 AI 行业简报,不会逐条发送动态。我们会先发送确认链接,未经确认不会投递。

  1. 1发送确认邮件链接 24 小时有效
  2. 2你点击确认防止他人冒用邮箱
  3. 3投递下一期报告含摘要、在线原文与退订链接
推送周期

Asia/Shanghai 当地时间 08:30 后投递已发布的下一期报告;不会补发确认前的历史期刊, 可随时从邮件退订。

今日看点

当日AI行业动态聚焦于模型量化与推理优化,Qwen3.8-27B系列…

当日AI行业动态聚焦于模型量化与推理优化,Qwen3.8-27B系列成为热点,多个社区版本通过MLX、GGUF量化及abliteration技术提升本地部署效率与可用性,同时llama.cpp、SGLang等推理框架密集更新,强化多后端支持与性能。产品层面,AWS推出ADOP平台以AI智能体缩短数据工程周期,优必选在WRC展示具身智能落地路径,而DSPy、Agno等开发工具则侧重沙箱隔离与代码生成能力优化。整体趋势显示,行业正从模型能力竞赛转向部署效率、工具链完善与场景化应用落地。

今日看点

3 个章节 · 12 条情报
  1. 01
    模型发布Qwen-3.8-27B 去审查版 8 位 MLX 量化发布
    3
  2. 02
    产品发布SGLang v0.5.18 发布:新增多模型支持与性能优化
    8
  3. 03
    研究进展新 imatrix 数据集发布:量化校准实验与发现
    1
01

模型发布

MODEL RELEASE3

Qwen-3.8-27B 去审查版 8 位 MLX 量化发布

junafinity 发布了 Qwen-3.8-27B-Uncensored-8-Bit-MLX,这是对 Qwen-3.8-27B-Uncensored 的 8 位 MLX 量化版本,专为 Apple Silicon 设计,磁盘占用 28GB,视觉塔保持 bf16 未量化。该模型通过 ZeroFuse 权重编辑实现去审查,旨在用于红队和防御性网络安全研究,作为对照实验中的处理组。模型仅支持 MLX 框架,不兼容 transformers 或 vLLM。

查看事件脉络阅读原文 ↗

Qwen3.8-27B 推出 16GB 显存适配的 GGUF 量化版

cHunter789 在 Hugging Face 上发布了 Qwen3.8-27B 模型的 GGUF 量化版本,采用 ik_llama.cpp 项目的 IQ4_KS 和 IQ4_KT 量化技术,旨在让模型适配 16GB 显存的 NVIDIA 显卡。该量化版本通过 q4_0 KV 缓存量化支持最长 110k 上下文,并对比了与 mradermacher 量化版本的困惑度,结果显示其性能略优。

查看事件脉络阅读原文 ↗

Qwen3.8-27B-OBLITERATED:零拒绝的未审查模型

OBLITERATUS 发布了 Qwen3.8-27B-OBLITERATED,一个基于 Qwen3.8-27B 的 abliterated 模型,通过混合 SVD 和 LEACE 方法去除拒绝机制,在保持 MMLU 84.3% 的同时实现零拒绝率。V3 版本进一步优化,在思考模式开启和关闭下均无拒绝,但 MMLU 略有下降。该模型支持 GGUF、safetensors 和 MLX 格式,并提供了详细的推理设置建议。

查看事件脉络阅读原文 ↗
02

产品发布

PRODUCT RELEASE8

SGLang v0.5.18 发布:新增多模型支持与性能优化

SGLang 发布 v0.5.18 版本,包含 710 个 PR,来自 212 位贡献者。新增支持 Muse Glimmer、Intern-S2-Mobius、SANA-Video、LingBot-Video-MoE、LTX-2.5、Cosmos3 Edge & Distilled、LongCat-Image 等模型,并优化了启动性能、LMHead 通信和缓存管理。该版本还更新了依赖,并增强了 Rust 服务器和推测解码功能。

查看事件脉络阅读原文 ↗

Agno v3.0.0a3 发布:新增 CodeMode、媒体卸载及多项性能优化

Agno 发布了 v3.0.0a3 版本,包含大量修复和新功能。主要改进包括:为代理和团队新增 CodeMode 和结果卸载功能,支持将媒体从数据库卸载到本地、S3 或 GCS 存储,引入 MigrationRequiredError 以处理过时的数据库模式,并优化了性能(如导入时间从 233ms 降至 147ms,会话查找变为 O(1))。此外,还增加了对 SuperGrok OAuth 设备码认证的支持,并更新了 Gemini 默认模型为 3.7 flash。

查看事件脉络阅读原文 ↗

DSPy 3.3.1 发布:强化沙箱隔离与优化器性能

DSPy 发布 3.3.1 版本,主要改进包括:PythonInterpreter 的安装简化、沙箱隔离强化和生命周期可观测性增强;优化器 GEPA 支持多提案采样和并发评估,提升吞吐量;同时修复了适配器正确性和 MCP 兼容性问题。该版本通过回调 API 提供完整的解释器执行追踪,并支持通过 gepa_kwargs 配置多目标优化。

查看事件脉络阅读原文 ↗

优必选WRC展台1:1复刻客户产线,展示具身智能落地路径

优必选在2026年WRC展会上将客户工厂的真实产线1:1搬进展台,展示工业人形机器人Cruzr S2和Cruzr Y1在汽车上下料、物流分拣等场景的连续作业能力,并推出商用机器人Walker C1和家庭机器人U1。公司提出理解、预测、执行三层具身大脑架构,包括Thinker基座大模型、Thinker-WM世界模型和Thinker-VLA,强调端侧部署和真实数据闭环。优必选已与多家企业合作,2025年营收超20亿元,人形机器人销量13838台,其中全尺寸机器人1079台,超80%应用于工业场景。

查看事件脉络阅读原文 ↗

AWS 发布 ADOP 平台:AI 智能体将数据工程周期缩短至数小时

AWS 发布了基于 Amazon Bedrock 的智能体数据操作平台(ADOP)参考架构,旨在将数据工程周期从数周缩短至数小时。ADOP 在开发环境中运行 AI 智能体,生成确定性的 ETL、质量检查和治理工件,并通过 CI/CD 部署到生产环境,生产环境不依赖模型调用。该平台支持多工具(如 Claude Code、Kiro、Cursor、Codex)的治理,并内置合规控制,适用于医疗、金融等受监管行业。

查看事件脉络阅读原文 ↗

llama.cpp b10580 发布:支持 dots3-note 视觉与音频

llama.cpp 发布 b10580 版本,主要更新是支持 dots3-note 模型的视觉和音频处理(PR #27524),包括文本转换、初始化实现和 GGUF 张量映射的修改。该版本提供了适用于 macOS、Linux、Android、Windows 和 openEuler 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。

查看事件脉络阅读原文 ↗

llama.cpp v0.2.0 发布:多后端优化与模型支持更新

llama.cpp 项目发布了 v0.2.0 版本,包含大量底层优化和修复,涉及 CUDA、SYCL、OpenCL、Vulkan、Metal 等多个后端。新增功能包括对 LFM2 模型的支持、GraniteSWA 模型、Mamba-2 的 OpenCL 移植,以及服务器端多项改进。该版本还提升了量化内存使用效率,并增强了 CI 和发布流程。

查看事件脉络阅读原文 ↗
03

研究进展

RESEARCH1

新 imatrix 数据集发布:量化校准实验与发现

Hugging Face 博客作者发布了新的 imatrix 校准数据集,并详细介绍了与 LTT Labs 团队合作进行的实验,测试不同数据集对量化模型性能的影响。实验发现,在低比特量化(如 Q2_K)下,imatrix 数据集的选择对 MoE 模型性能影响显著,但对高比特量化影响不大。作者公开了数据集和渲染脚本,并计划继续迭代。

查看事件脉络阅读原文 ↗
12独立事件
11一手报道
8发布来源
8 min读完本期
逐条速览当天值得追踪的 AI 变化所有事实条目均可回到原始发布方核验
阅读周报
已发布总述由 deepseek-v4-flash 生成;条目来自已保存的精选与 Story,事实以原文为准。生成于 2026/8/22 23:33:09 · report-v3