VOL. 2026-08-22 · 12 STORIES · DAILY INTELLIGENCE

AI HOT RADAR 日报

新一期发布后,可按你的时区发送
REPORT DELIVERY

把报告送到邮箱

订阅整期 AI 行业简报,不会逐条发送动态。我们会先发送确认链接,未经确认不会投递。

  1. 1发送确认邮件链接 24 小时有效
  2. 2你点击确认防止他人冒用邮箱
  3. 3投递下一期报告含摘要、在线原文与退订链接
推送周期

按 Asia/Shanghai 当地时间 08:30 后投递已发布的下一期报告;不会补发确认前的历史期刊, 可随时从邮件退订。

今日看点

当日AI行业动态集中在模型量化与推理框架的密集迭代上

当日AI行业动态集中在模型量化与推理框架的密集迭代上。Qwen-3.8-27B成为焦点,多个社区版本分别针对Apple Silicon和16GB显存的NVIDIA GPU推出MLX与GGUF量化适配,显著降低了部署门槛。推理引擎方面,SGLang v0.5.18、llama.cpp多版本及DSPy 3.3.1均带来性能优化与功能增强,其中llama.cpp着重修复draft模型上下文问题并扩展多后端支持。具身智能领域,优必选与魔法原子在WRC 2026上展示了工业产线复刻、四足机器狗等落地场景,强调从理解到执行的全链路能力。此外,AWS发布ADOP平台,利用AI智能体将数据工程周期从数周压缩至数小时,体现了AI在数据基础设施中的渗透。整体来看,当日趋势以模型轻量化部署、推理效率提升和具身智能商业化落地为主线。

今日看点

2 个章节 · 12 条情报
  1. 01
    模型发布Qwen-3.8-27B 去审查版 8 位 MLX 量化发布
    3
  2. 02
    产品发布SGLang v0.5.18 发布:新增多模型支持与性能优化
    9
01

模型发布

MODEL RELEASE3 篇

Qwen-3.8-27B 去审查版 8 位 MLX 量化发布

junafinity 发布了 Qwen-3.8-27B-Uncensored-8-Bit-MLX,这是对 Qwen-3.8-27B-Uncensored 的 8 位 MLX 量化版本,专为 Apple Silicon 设计,磁盘占用 28GB,视觉塔保持 bf16 未量化。该模型通过 ZeroFuse 权重编辑实现去审查,旨在用于红队和防御性网络安全研究,作为对照实验中的处理组。模型仅支持 MLX 框架,不兼容 transformers 或 vLLM。

阅读原文 ↗

Qwen3.8-27B 推出 16GB 显存适配的 GGUF 量化版

cHunter789 在 Hugging Face 上发布了 Qwen3.8-27B 模型的 GGUF 量化版本,采用 ik_llama.cpp 项目的 IQ4_KS 和 IQ4_KT 量化技术,旨在让模型适配 16GB 显存的 NVIDIA 显卡。该量化版本通过 q4_0 KV 缓存量化支持最长 110k 上下文,并对比了与 mradermacher 量化版本的困惑度,结果显示其性能略优。

阅读原文 ↗

KAT-Coder-V2.5-Dev APEX GGUF 发布:MTP 头实现 2 倍加速

Hugging Face 上发布了 KAT-Coder-V2.5-Dev 模型的 APEX GGUF 量化版本,该版本移植了 Qwen3.6-35B-A3B 的 MTP 头,实现了投机解码加速。实测在 agentic 编码任务上最高获得 2.03 倍加速,且正确性不变。推荐使用 n-max 3 的投机深度设置,并提供了详细的性能对比数据。

阅读原文 ↗
02

产品发布

PRODUCT RELEASE9 篇

SGLang v0.5.18 发布:新增多模型支持与性能优化

SGLang 发布 v0.5.18 版本,包含 710 个 PR,来自 212 位贡献者。新增支持 Muse Glimmer、Intern-S2-Mobius、SANA-Video、LingBot-Video-MoE、LTX-2.5、Cosmos3 Edge & Distilled、LongCat-Image 等模型,并优化了启动性能、LMHead 通信和缓存管理。该版本还更新了依赖,并增强了 Rust 服务器和推测解码功能。

阅读原文 ↗

Agno v3.0.0a3 发布:新增 CodeMode、媒体卸载及多项性能优化

Agno 发布了 v3.0.0a3 版本,包含大量修复和新功能。主要改进包括:为代理和团队新增 CodeMode 和结果卸载功能,支持将媒体从数据库卸载到本地、S3 或 GCS 存储,引入 MigrationRequiredError 以处理过时的数据库模式,并优化了性能(如导入时间从 233ms 降至 147ms,会话查找变为 O(1))。此外,还增加了对 SuperGrok OAuth 设备码认证的支持,并更新了 Gemini 默认模型为 3.7 flash。

阅读原文 ↗

DSPy 3.3.1 发布:强化沙箱隔离与优化器性能

DSPy 发布 3.3.1 版本,主要改进包括:PythonInterpreter 的安装简化、沙箱隔离强化和生命周期可观测性增强;优化器 GEPA 支持多提案采样和并发评估,提升吞吐量;同时修复了适配器正确性和 MCP 兼容性问题。该版本通过回调 API 提供完整的解释器执行追踪,并支持通过 gepa_kwargs 配置多目标优化。

阅读原文 ↗

优必选WRC展台1:1复刻客户产线,展示具身智能落地路径

优必选在2026年WRC展会上将客户工厂的真实产线1:1搬进展台,展示工业人形机器人Cruzr S2和Cruzr Y1在汽车上下料、物流分拣等场景的连续作业能力,并推出商用机器人Walker C1和家庭机器人U1。公司提出理解、预测、执行三层具身大脑架构,包括Thinker基座大模型、Thinker-WM世界模型和Thinker-VLA,强调端侧部署和真实数据闭环。优必选已与多家企业合作,2025年营收超20亿元,人形机器人销量13838台,其中全尺寸机器人1079台,超80%应用于工业场景。

阅读原文 ↗

AWS 发布 ADOP 平台:AI 智能体将数据工程周期缩短至数小时

AWS 发布了基于 Amazon Bedrock 的智能体数据操作平台(ADOP)参考架构,旨在将数据工程周期从数周缩短至数小时。ADOP 在开发环境中运行 AI 智能体,生成确定性的 ETL、质量检查和治理工件,并通过 CI/CD 部署到生产环境,生产环境不依赖模型调用。该平台支持多工具(如 Claude Code、Kiro、Cursor、Codex)的治理,并内置合规控制,适用于医疗、金融等受监管行业。

阅读原文 ↗

llama.cpp b10580 发布:支持 dots3-note 视觉与音频

llama.cpp 发布 b10580 版本,主要更新是支持 dots3-note 模型的视觉和音频处理(PR #27524),包括文本转换、初始化实现和 GGUF 张量映射的修改。该版本提供了适用于 macOS、Linux、Android、Windows 和 openEuler 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。

阅读原文 ↗

llama.cpp v0.2.0 发布:多后端优化与模型支持更新

llama.cpp 项目发布了 v0.2.0 版本,包含大量底层优化和修复,涉及 CUDA、SYCL、OpenCL、Vulkan、Metal 等多个后端。新增功能包括对 LFM2 模型的支持、GraniteSWA 模型、Mamba-2 的 OpenCL 移植,以及服务器端多项改进。该版本还提升了量化内存使用效率,并增强了 CI 和发布流程。

阅读原文 ↗

魔法原子WRC 2026展示三大场景解决方案,发布四足机器狗T1

魔法原子在WRC 2026上展示了工业制造、物流分拣、公共安全三大场景的具身智能解决方案,并发布了轻工业四足机器狗MagicDog T1。公司展示了自研通用具身大模型Magic-VLA K02的进化能力,包括超长程任务规划、柔性衣物整理和叠盒贴胶等demo。魔法原子目前在手订单超11亿元,产品覆盖近30国,海外收入占四成,并获评2026全球具身智能标杆企业TOP100。

阅读原文 ↗
12独立事件
10一手报道
7发布来源
≈9 min读完本期
逐条速览当天值得追踪的 AI 变化所有事实条目均可回到原始发布方核验
阅读周报 →
已发布总述由 deepseek-v4-flash 生成;条目来自已保存的精选与 Story,事实以原文为准。生成于 2026/8/23 22:34:16 · report-v3