Qwen3.8-Flash-Next 的 MTPLX 4-bit 量化版发布
原标题:Youssofal/Qwen3.8-Flash-Next-MTPLX-Bare-Speed
AI 摘要
Hugging Face 用户 Youssofal 发布了 Qwen3.8-Flash-Next 的 MTPLX 量化版本 Bare Speed,基于 Qwen 125B-A6B Flash-Next 预览模型,采用统一 4-bit 量化并保留 16-bit 关键组件,通过 MTPLX 在 Apple Silicon 上实现原生多 token 预测投机解码。在 M5 Max 128GB 上实测投机解码达 75.9 tok/s,约为普通自回归 47.0 tok/s 的 1.6 倍,且声称任意温度下输出精确。该版本面向 96GB 以上统一内存的 Mac,支持 262,144 token 上下文,n-gram 表从 SSD 流式加载。
正文节选
--- license: other license_name: qwen-community-1.0 license_link: LICENSE library_name: mtplx pipeline_tag: text-generation base_model: Qwen/Qwen3.8-Flash-Next base_model_relation: quantized tags: - mlx - apple-silicon - macos - speculative-decoding - multi-token-prediction - qwen - qwen3.8-flash-next - moe - mtp - mtplx - local-ai - chat - qwen3.8 - qwen3-8 - qwen-3.8 - local-llm - llm - m5 - m5-max - m4 - m3 - macbook-pro - mac-studio - opencode - claude-code - flash-next - qwen3-8-flash-next