Qwen3.8 Flash Next MLX oQ4 量化版发布,支持原生 MTP
原标题:Vontra/Qwen3.8-Flash-Next-MLX-oQ4-MTP
AI 摘要
Vontra 发布了 Qwen3.8-Flash-Next 的 MLX oQ4 混合精度量化版本,保留了原生 MTP 草稿块,专为 Apple Silicon 优化。该转换基于官方 BF16 检查点,包含 232 个保护模块,总权重 113.33 GB,支持 262,144 token 上下文。在 Apple M3 Studio 上测试,原生 MTP 启用时速度可达 39.7 tokens/s,草稿接受率 58.3-89.5%。此转换非官方发布,遵循 Qwen Community License 1.0。
正文节选
--- library_name: mlx license: other license_name: qwen-community-1.0 license_link: LICENSE base_model: Qwen/Qwen3.8-Flash-Next base_model_relation: quantized pipeline_tag: image-text-to-text tags: - mlx - mlx-vlm - omlx - oq - mtp - speculative-decoding - qwen - qwen3.8 - mixture-of-experts - vision-language - quantized - apple-silicon - 4-bit --- <p align="center"> <a href="https://qwen.ai/"><img src="qwen-logo.png" width="96" height="95" alt="Qwen"></a> </p> <p