Vontra 发布 Qwen3.8-Flash-Next MLX 4-bit 量化版
原标题:Vontra/Qwen3.8-Flash-Next-MLX-4bit
AI 摘要
Vontra 发布了 Qwen3.8-Flash-Next 的 MLX 4-bit 量化版本,基于官方 BF16 检查点转换,适用于 Apple Silicon。该模型采用 qwen4_exp 架构,支持视觉语言任务,配置上下文长度达 262,144 tokens。在 M3 Studio 上测试,oMLX 服务器生成速度约 24-26 tokens/s,独立 MLX 测试约 31 tokens/s。此转换非官方发布,需使用支持 qwen4_exp 的 MLX-VLM 运行时。
正文节选
--- library_name: mlx license: other license_name: qwen-community-1.0 license_link: LICENSE base_model: Qwen/Qwen3.8-Flash-Next base_model_relation: quantized pipeline_tag: image-text-to-text tags: - mlx - mlx-vlm - omlx - qwen - qwen3.8 - mixture-of-experts - vision-language - quantized - apple-silicon - 4-bit --- <p align="center"> <img src="https://img.shields.io/badge/Qwen-Qwen3.8-615CED?style=for-the-badge&logo=qwen&logoColor=white" alt="Qwen Qwen3.8"> <img src="ht