返回全部动态

Qwen3.8-27B ROCmFP4 量化版发布,AMD Strix Halo 上解码速度提升 2.83 倍

原标题:kingjones777/Qwen3.8-27B-ROCmFP4-STRIX-MTP-GGUF

Hugging Face New and Trending Models一手来源模型发布质量 87

AI 摘要

kingjones777 发布了 Qwen3.8-27B 的 ROCmFP4 量化版本,专为 AMD Strix Halo 平台优化,并捆绑了多 token 预测(MTP)草稿头。该版本在 AMD Ryzen AI Max+ 395 上实现了 30.30 tok/s 的解码速度,是标准 Q4_K_M 的 2.83 倍,同时困惑度与 Q4_K_M 持平。作者发布了详细的基准测试和 MTP 调优曲线,并指出 llama.cpp 默认的 --spec-draft-n-max 值并非最优。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

--- license: apache-2.0 base_model: Qwen/Qwen3.8-27B base_model_relation: quantized pipeline_tag: text-generation library_name: gguf tags: - gguf - llama.cpp - rocm - amd - rocmfp4 - rocmfpx - strix-halo - amd-strix-halo - gfx1151 - ryzen-ai-max - ryzen-ai-max-395 - radeon-8060s - mtp - speculative-decoding - reasoning - qwen3.5 - quantized --- # Qwen3.8-27B — ROCmFP4 for AMD Strix Halo (gfx1151) <!-- LEAD-CLAIM:START --> > ✅ **the only public ROCmFP4 build o


发布时间:2026-09-01 02:36
抓取时间:2026-09-01 01:49
来源机构:Hugging Face
阅读原文huggingface.co