Qwen3.8-Flash-Next 剪枝版:体积缩小28%,性能持平
原标题:Cyronius/Qwen3.8-Flash-Next-131B-A6B-GGUF
AI 摘要
Cyronius 发布了一个名为 Qwen3.8-Flash-Next-131B-A6B-GGUF 的模型,通过对 Qwen3.8-Flash-Next 的 n-gram 哈希嵌入表进行剪枝,将 GGUF 大小从 90GB 降至 64.8GB,同时保持工具调用、GSM8K 和 MMLU 基准性能不变。该模型无需训练或修改 transformer 架构,仅保留 16 个哈希头中的 2 个,利用多哈希冗余。尽管困惑度从 2.40 升至 4.66,但推理和工具使用能力未受影响。该模型兼容 llama.cpp 2026-08-27 或更新版本,并提供了完整的构建脚本和实验日志。
正文节选
--- license: other license_name: qwen-community-1.0 license_link: https://huggingface.co/Qwen/Qwen3.8-Flash-Next/blob/main/LICENSE base_model: Qwen/Qwen3.8-Flash-Next tags: - moe - pruning - quantization - gguf - hash-embedding - llama.cpp pipeline_tag: text-generation --- # Qwen3.8-Flash-Next-131B-A6B (n-gram table pruned, GGUF) A 64.8 GB GGUF of [Qwen/Qwen3.8-Flash-Next](https://huggingface.co/Qwen/Qwen3.8-Flash-Next) that scores at parity with the full 90 GB quant on tool-calling, GSM8K, an