返回全部动态

Nail-Qwen3.6-35B-A3B-GGUF-MTP 量化模型发布

原标题:peculiar-ragdoll/Nail-Qwen3.6-35B-A3B-GGUF-MTP

Hugging Face New and Trending Models一手来源模型发布质量 45

AI 摘要

Hugging Face 用户 peculiar-ragdoll 发布了 Nail-Qwen3.6-35B-A3B-GGUF-MTP,这是基于 Qwen3.6-35B-A3B 的 4-bit GGUF 量化模型,保留了标准量化中被丢弃的多 token 预测(MTP/nextn)张量,并内置改进的聊天模板与强制系统提示。该模型面向推理、多轮对话和 agentic 软件工程场景,在 MMLU-Pro、Claw-Eval 多轮对话及 Pi 编码 agent 等基准上宣称与 Qwen3.6-27b 及 ThinkingCap 微调版精度持平,同时回答更快、多轮质量更好。MTP 张量可在支持投机解码的运行时(如 vLLM/SGLang)带来约 1.5–2 倍推理加速,llama.cpp 需较新源码构建并配合 --spec-type draft-mtp 使用。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

--- license: apache-2.0 license_link: https://huggingface.co/Qwen/Qwen3.6-35B-A3B/blob/main/LICENSE language: - en - zh base_model: Qwen/Qwen3.6-35B-A3B base_model_relation: quantized library_name: gguf pipeline_tag: image-text-to-text tags: - gguf - llama.cpp - qwen3_6 - moe - mtp - speculative-decoding - token-efficient - efficient-thinking - agentic-coding - 4-bit --- <div align="center"> <img src="assets/nail_banner_eyebrow.png" alt="Nail — Qwen3.6-35B-A3B, sharpe


发布时间:2026-09-10 23:56
抓取时间:2026-08-15 17:42
来源机构:Hugging Face
阅读原文huggingface.co