返回全部动态

Qwen3.8-Flash-Next 剪枝版:体积缩小28%,性能持平

原标题:Cyronius/Qwen3.8-Flash-Next-131B-A6B-GGUF

Hugging Face New and Trending Models一手来源模型发布质量 87

AI 摘要

Cyronius 发布了一个名为 Qwen3.8-Flash-Next-131B-A6B-GGUF 的模型,通过对 Qwen3.8-Flash-Next 的 n-gram 哈希嵌入表进行剪枝,将 GGUF 大小从 90GB 降至 64.8GB,同时保持工具调用、GSM8K 和 MMLU 基准性能不变。该模型无需训练或修改 transformer 架构,仅保留 16 个哈希头中的 2 个,利用多哈希冗余。尽管困惑度从 2.40 升至 4.66,但推理和工具使用能力未受影响。该模型兼容 llama.cpp 2026-08-27 或更新版本,并提供了完整的构建脚本和实验日志。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

--- license: other license_name: qwen-community-1.0 license_link: https://huggingface.co/Qwen/Qwen3.8-Flash-Next/blob/main/LICENSE base_model: Qwen/Qwen3.8-Flash-Next tags: - moe - pruning - quantization - gguf - hash-embedding - llama.cpp pipeline_tag: text-generation --- # Qwen3.8-Flash-Next-131B-A6B (n-gram table pruned, GGUF) A 64.8 GB GGUF of [Qwen/Qwen3.8-Flash-Next](https://huggingface.co/Qwen/Qwen3.8-Flash-Next) that scores at parity with the full 90 GB quant on tool-calling, GSM8K, an


发布时间:2026-09-07 05:49
抓取时间:2026-09-07 05:54
来源机构:Hugging Face
阅读原文huggingface.co