Qwen3.8-27B MTPLX 优化速度 FP16 版发布
原标题:Youssofal/Qwen3.8-27B-MTPLX-Optimized-Speed-FP16
AI 摘要
Hugging Face 上发布了 Youssofal/Qwen3.8-27B-MTPLX-Optimized-Speed-FP16,这是 Qwen3.8-27B 的 MLX 量化包,面向 M1/M2 Mac 的 FP16 版本,权重与父版本逐字节一致,仅将浮点张量以 fp16 存储。该版本基于 MTPLX 实现原生多 token 预测投机解码,官方称速度可达普通解码的 2-3 倍,并在任意温度下保持精确。发布方给出了 M5 Max 上的吞吐与质量数据,并说明 MTPLX 应用会自动为 M1/M2 选择该 FP16 构建。
正文节选
--- license: apache-2.0 library_name: mtplx pipeline_tag: text-generation base_model: Qwen/Qwen3.8-27B base_model_relation: quantized tags: - mlx - apple-silicon - macos - m1 - m2 - fp16 - speculative-decoding - multi-token-prediction - qwen - qwen3.8 - mtp - mtplx - local-ai - coding - qwen3-8 - qwen-3.8 - local-llm - llm - m5 - m5-max - m4 - m3 - macbook-pro - mac-studio - opencode - claude-code - 27b - qwen3.8-27b - qwen3-8-27b --- **[MTPLX](https://mtplx.com): the fastest way to run Qwen 3.