返回全部动态

GLM-5.2 量化模型发布:混合精度专家与融合 MoE 优化

原标题:brandonmusic/GLM-5.2-EXL3-TR3v4-3.5bpw-MTP78

Hugging Face New and Trending Models一手来源模型发布质量 85

AI 摘要

Hugging Face 上发布了 brandonmusic/GLM-5.2-EXL3-TR3v4-3.5bpw-MTP78 模型,基于 zai-org/GLM-5.2,采用 trellis 量化与混合精度专家,支持 MTP-78。该模型在 4x RTX PRO 6000 Blackwell 上实现了 KLD 0.061282(fp8 KV)和 0.069527(nvfp4 KV),解码速度最高 115.5 tok/s。文章还详细说明了融合 MoE 路径的优化、外尺度文件的重要性以及修复的 SparkInfer 索引 bug。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

--- base_model: zai-org/GLM-5.2 library_name: trellis tags: - exl3 - trellis - quantization - glm - moe - mixed-precision --- # GLM-5.2 EXL3 TR3 v4 — 3.5 bpw mixed experts, MTP-78 ## Run it Docker image (public on Docker Hub): ``` verdictai/glm52-exl3-sparkinfer:v26-gg-v20final-scopefix-archkey-vllm5517197-sibe0edca-cu132-sm120a ``` ```bash docker pull verdictai/glm52-exl3-sparkinfer:v26-gg-v20final-scopefix-archkey-vllm5517197-sibe0edca-cu132-sm120a hf download brandonmusic/GLM-5.2-EXL3-TR


发布时间:2026-08-08 01:39
抓取时间:2026-08-08 01:40
来源机构:Hugging Face
阅读原文huggingface.co