返回全部动态

KAT-Coder-V2.5-Dev APEX GGUF 发布:MTP 头实现 2 倍加速

原标题:Myric/KAT-Coder-V2.5-Dev-MTP-APEX-GGUF

Hugging Face New and Trending Models一手来源模型发布质量 85

AI 摘要

Hugging Face 上发布了 KAT-Coder-V2.5-Dev 模型的 APEX GGUF 量化版本,该版本移植了 Qwen3.6-35B-A3B 的 MTP 头,实现了投机解码加速。实测在 agentic 编码任务上最高获得 2.03 倍加速,且正确性不变。推荐使用 n-max 3 的投机深度设置,并提供了详细的性能对比数据。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

--- license: apache-2.0 base_model: Kwaipilot/KAT-Coder-V2.5-Dev base_model_relation: quantized pipeline_tag: text-generation library_name: gguf tags: - gguf - moe - apex - quantized - imatrix - torch-imatrix - mtp - speculative-decoding - qwen3_5_moe - coding - agentic-coding - llama.cpp --- # KAT-Coder-V2.5-Dev — APEX GGUF with MTP head MoE-aware, mixed-precision **APEX** quantization of [Kwaipilot/KAT-Coder-V2.5-Dev](https://huggingface.co/Kwaipilot/KAT-Coder-V2.5-De


发布时间:2026-08-22 03:16
抓取时间:2026-08-22 03:17
来源机构:Hugging Face
阅读原文huggingface.co