返回全部动态
KAT-Coder-V2.5-Dev APEX GGUF 发布:MTP 头实现 2 倍加速
原标题:Myric/KAT-Coder-V2.5-Dev-MTP-APEX-GGUF
AI 摘要
Hugging Face 上发布了 KAT-Coder-V2.5-Dev 模型的 APEX GGUF 量化版本,该版本移植了 Qwen3.6-35B-A3B 的 MTP 头,实现了投机解码加速。实测在 agentic 编码任务上最高获得 2.03 倍加速,且正确性不变。推荐使用 n-max 3 的投机深度设置,并提供了详细的性能对比数据。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
--- license: apache-2.0 base_model: Kwaipilot/KAT-Coder-V2.5-Dev base_model_relation: quantized pipeline_tag: text-generation library_name: gguf tags: - gguf - moe - apex - quantized - imatrix - torch-imatrix - mtp - speculative-decoding - qwen3_5_moe - coding - agentic-coding - llama.cpp --- # KAT-Coder-V2.5-Dev — APEX GGUF with MTP head MoE-aware, mixed-precision **APEX** quantization of [Kwaipilot/KAT-Coder-V2.5-Dev](https://huggingface.co/Kwaipilot/KAT-Coder-V2.5-De
发布时间:2026-08-22 03:16
抓取时间:2026-08-22 03:17
来源机构:Hugging Face