返回全部动态

Qwen3.8 Flash Next MLX oQ4 量化版发布,支持原生 MTP

原标题:Vontra/Qwen3.8-Flash-Next-MLX-oQ4-MTP

Hugging Face New and Trending Models一手来源模型发布质量 83

AI 摘要

Vontra 发布了 Qwen3.8-Flash-Next 的 MLX oQ4 混合精度量化版本,保留了原生 MTP 草稿块,专为 Apple Silicon 优化。该转换基于官方 BF16 检查点,包含 232 个保护模块,总权重 113.33 GB,支持 262,144 token 上下文。在 Apple M3 Studio 上测试,原生 MTP 启用时速度可达 39.7 tokens/s,草稿接受率 58.3-89.5%。此转换非官方发布,遵循 Qwen Community License 1.0。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

--- library_name: mlx license: other license_name: qwen-community-1.0 license_link: LICENSE base_model: Qwen/Qwen3.8-Flash-Next base_model_relation: quantized pipeline_tag: image-text-to-text tags: - mlx - mlx-vlm - omlx - oq - mtp - speculative-decoding - qwen - qwen3.8 - mixture-of-experts - vision-language - quantized - apple-silicon - 4-bit --- <p align="center"> <a href="https://qwen.ai/"><img src="qwen-logo.png" width="96" height="95" alt="Qwen"></a> </p> <p


发布时间:2026-09-08 19:30
抓取时间:2026-09-08 19:32
来源机构:Hugging Face
阅读原文huggingface.co