VOL. 2026-08-22 · 12 STORIES · DAILY INTELLIGENCE
AI HOT RADAR 日报
2026-08-22 · PUBLISHED · 约 8 分钟
当日AI行业动态聚焦于模型量化与推理优化,Qwen3.8-27B系列…
当日AI行业动态聚焦于模型量化与推理优化,Qwen3.8-27B系列成为热点,多个社区版本通过MLX、GGUF量化及abliteration技术提升本地部署效率与可用性,同时llama.cpp、SGLang等推理框架密集更新,强化多后端支持与性能。产品层面,AWS推出ADOP平台以AI智能体缩短数据工程周期,优必选在WRC展示具身智能落地路径,而DSPy、Agno等开发工具则侧重沙箱隔离与代码生成能力优化。整体趋势显示,行业正从模型能力竞赛转向部署效率、工具链完善与场景化应用落地。
今日看点
3 个章节 · 12 条情报- 01模型发布Qwen-3.8-27B 去审查版 8 位 MLX 量化发布3
- 02产品发布SGLang v0.5.18 发布:新增多模型支持与性能优化8
- 03研究进展新 imatrix 数据集发布:量化校准实验与发现1
模型发布
MODEL RELEASE3 篇Qwen-3.8-27B 去审查版 8 位 MLX 量化发布
junafinity 发布了 Qwen-3.8-27B-Uncensored-8-Bit-MLX,这是对 Qwen-3.8-27B-Uncensored 的 8 位 MLX 量化版本,专为 Apple Silicon 设计,磁盘占用 28GB,视觉塔保持 bf16 未量化。该模型通过 ZeroFuse 权重编辑实现去审查,旨在用于红队和防御性网络安全研究,作为对照实验中的处理组。模型仅支持 MLX 框架,不兼容 transformers 或 vLLM。
Qwen3.8-27B 推出 16GB 显存适配的 GGUF 量化版
cHunter789 在 Hugging Face 上发布了 Qwen3.8-27B 模型的 GGUF 量化版本,采用 ik_llama.cpp 项目的 IQ4_KS 和 IQ4_KT 量化技术,旨在让模型适配 16GB 显存的 NVIDIA 显卡。该量化版本通过 q4_0 KV 缓存量化支持最长 110k 上下文,并对比了与 mradermacher 量化版本的困惑度,结果显示其性能略优。
Qwen3.8-27B-OBLITERATED:零拒绝的未审查模型
OBLITERATUS 发布了 Qwen3.8-27B-OBLITERATED,一个基于 Qwen3.8-27B 的 abliterated 模型,通过混合 SVD 和 LEACE 方法去除拒绝机制,在保持 MMLU 84.3% 的同时实现零拒绝率。V3 版本进一步优化,在思考模式开启和关闭下均无拒绝,但 MMLU 略有下降。该模型支持 GGUF、safetensors 和 MLX 格式,并提供了详细的推理设置建议。
产品发布
PRODUCT RELEASE8 篇SGLang v0.5.18 发布:新增多模型支持与性能优化
SGLang 发布 v0.5.18 版本,包含 710 个 PR,来自 212 位贡献者。新增支持 Muse Glimmer、Intern-S2-Mobius、SANA-Video、LingBot-Video-MoE、LTX-2.5、Cosmos3 Edge & Distilled、LongCat-Image 等模型,并优化了启动性能、LMHead 通信和缓存管理。该版本还更新了依赖,并增强了 Rust 服务器和推测解码功能。
Agno v3.0.0a3 发布:新增 CodeMode、媒体卸载及多项性能优化
Agno 发布了 v3.0.0a3 版本,包含大量修复和新功能。主要改进包括:为代理和团队新增 CodeMode 和结果卸载功能,支持将媒体从数据库卸载到本地、S3 或 GCS 存储,引入 MigrationRequiredError 以处理过时的数据库模式,并优化了性能(如导入时间从 233ms 降至 147ms,会话查找变为 O(1))。此外,还增加了对 SuperGrok OAuth 设备码认证的支持,并更新了 Gemini 默认模型为 3.7 flash。
DSPy 3.3.1 发布:强化沙箱隔离与优化器性能
DSPy 发布 3.3.1 版本,主要改进包括:PythonInterpreter 的安装简化、沙箱隔离强化和生命周期可观测性增强;优化器 GEPA 支持多提案采样和并发评估,提升吞吐量;同时修复了适配器正确性和 MCP 兼容性问题。该版本通过回调 API 提供完整的解释器执行追踪,并支持通过 gepa_kwargs 配置多目标优化。
优必选WRC展台1:1复刻客户产线,展示具身智能落地路径
优必选在2026年WRC展会上将客户工厂的真实产线1:1搬进展台,展示工业人形机器人Cruzr S2和Cruzr Y1在汽车上下料、物流分拣等场景的连续作业能力,并推出商用机器人Walker C1和家庭机器人U1。公司提出理解、预测、执行三层具身大脑架构,包括Thinker基座大模型、Thinker-WM世界模型和Thinker-VLA,强调端侧部署和真实数据闭环。优必选已与多家企业合作,2025年营收超20亿元,人形机器人销量13838台,其中全尺寸机器人1079台,超80%应用于工业场景。
llama.cpp b10584 发布:修复 draft 上下文并优化内存适配
llama.cpp 发布 b10584 版本,主要修复了 draft 模型上下文大小与目标上下文不匹配的问题,并优化了内存适配逻辑。该版本还引入了可选的第二模型支持,使 draft 或 MTP 上下文的内存测量更精确,同时移除了服务器中的预留块。
AWS 发布 ADOP 平台:AI 智能体将数据工程周期缩短至数小时
AWS 发布了基于 Amazon Bedrock 的智能体数据操作平台(ADOP)参考架构,旨在将数据工程周期从数周缩短至数小时。ADOP 在开发环境中运行 AI 智能体,生成确定性的 ETL、质量检查和治理工件,并通过 CI/CD 部署到生产环境,生产环境不依赖模型调用。该平台支持多工具(如 Claude Code、Kiro、Cursor、Codex)的治理,并内置合规控制,适用于医疗、金融等受监管行业。
llama.cpp b10580 发布:支持 dots3-note 视觉与音频
llama.cpp 发布 b10580 版本,主要更新是支持 dots3-note 模型的视觉和音频处理(PR #27524),包括文本转换、初始化实现和 GGUF 张量映射的修改。该版本提供了适用于 macOS、Linux、Android、Windows 和 openEuler 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
llama.cpp v0.2.0 发布:多后端优化与模型支持更新
llama.cpp 项目发布了 v0.2.0 版本,包含大量底层优化和修复,涉及 CUDA、SYCL、OpenCL、Vulkan、Metal 等多个后端。新增功能包括对 LFM2 模型的支持、GraniteSWA 模型、Mamba-2 的 OpenCL 移植,以及服务器端多项改进。该版本还提升了量化内存使用效率,并增强了 CI 和发布流程。
研究进展
RESEARCH1 篇新 imatrix 数据集发布:量化校准实验与发现
Hugging Face 博客作者发布了新的 imatrix 校准数据集,并详细介绍了与 LTT Labs 团队合作进行的实验,测试不同数据集对量化模型性能的影响。实验发现,在低比特量化(如 Q2_K)下,imatrix 数据集的选择对 MoE 模型性能影响显著,但对高比特量化影响不大。作者公开了数据集和渲染脚本,并计划继续迭代。