Qwen3.8-Flash-Next 混合量化 SSD-PLE GGUF 发布
原标题:Baekpica/Qwen3.8-Flash-Next-Mixed-Quant-SSD-PLE-GGUF
AI 摘要
Baekpica 发布了 Qwen3.8-Flash-Next 的混合量化 GGUF 模型,采用 SSD-PLE 技术将 51.2B 参数的预测性潜在嵌入表移至 SSD,以 BF16 存储,从而将显存预算分配给 128.8B 参数的计算主干。在单个 NVIDIA DGX Spark 上,Q5 变体实现了 606.4 tok/s 的中位冷预填充速度和 28.3 tok/s 的聚合解码速度,并验证了原生图像输入。该模型需要专用的 ds4 SSD-PLE 加载器,不兼容主流 GGUF 运行时。
正文节选
--- license: other license_name: qwen-community-1.0 license_link: https://huggingface.co/Qwen/Qwen3.8-Flash-Next/blob/f5d08274bafd880402bd16f5e3e6c514136ec06c/LICENSE base_model: Qwen/Qwen3.8-Flash-Next base_model_relation: quantized pipeline_tag: image-text-to-text tags: - gguf - mixed-quant - qwen4exp - qwen3.8-flash-next - dgx-spark - ds4 - ssd-offload --- # Qwen3.8-Flash-Next Mixed-Quant SSD-PLE GGUF > **Two accelerator-resident precision variants are published with one share