返回全部动态

Qwen3.8-Flash-Next 混合量化 SSD-PLE GGUF 发布

原标题:Baekpica/Qwen3.8-Flash-Next-Mixed-Quant-SSD-PLE-GGUF

Hugging Face New and Trending Models一手来源模型发布质量 75

AI 摘要

Baekpica 发布了 Qwen3.8-Flash-Next 的混合量化 GGUF 模型,采用 SSD-PLE 技术将 51.2B 参数的预测性潜在嵌入表移至 SSD,以 BF16 存储,从而将显存预算分配给 128.8B 参数的计算主干。在单个 NVIDIA DGX Spark 上,Q5 变体实现了 606.4 tok/s 的中位冷预填充速度和 28.3 tok/s 的聚合解码速度,并验证了原生图像输入。该模型需要专用的 ds4 SSD-PLE 加载器,不兼容主流 GGUF 运行时。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

--- license: other license_name: qwen-community-1.0 license_link: https://huggingface.co/Qwen/Qwen3.8-Flash-Next/blob/f5d08274bafd880402bd16f5e3e6c514136ec06c/LICENSE base_model: Qwen/Qwen3.8-Flash-Next base_model_relation: quantized pipeline_tag: image-text-to-text tags: - gguf - mixed-quant - qwen4exp - qwen3.8-flash-next - dgx-spark - ds4 - ssd-offload --- # Qwen3.8-Flash-Next Mixed-Quant SSD-PLE GGUF > **Two accelerator-resident precision variants are published with one share


发布时间:2026-09-01 18:25
抓取时间:2026-09-01 18:28
来源机构:Hugging Face
阅读原文huggingface.co