返回全部动态

Prism ML 发布三值量化 Bonsai 2 27B GGUF 模型

原标题:prism-ml/Ternary-Bonsai-2-27B-gguf

Hugging Face New and Trending Models一手来源模型发布质量 80

AI 摘要

Prism ML 在 Hugging Face 发布 Bonsai 2 27B 的 GGUF 版本,基于 Qwen3.8-27B 架构,将全部语言权重(嵌入、注意力投影、MLP 投影、LM head)量化为三值 {-1,0,+1},以约 1.72 bits/weight 存储,模型体积约 5.95 GB(PTQ1_0)或 7.21 GB(PQ2_0),相比 FP16 缩小约 9.3 倍。官方称保留 98.2% 的 FP16 智能水平,在 14 项思考模式基准上平均 84.78,并支持 262K 上下文、思考/推理/工具调用行为,可在 llama.cpp(CUDA、Metal、CPU)上运行,Apple M5 Max 笔记本上约 47 tok/s。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

--- license: apache-2.0 library_name: llama.cpp pipeline_tag: text-generation tags: - ternary - 2-bit - gguf - llama-cpp - cuda - metal - on-device - hybrid-attention - prismml - bonsai base_model: - Qwen/Qwen3.8-27B --- <p align="center"> <img src="./assets/bonsai-logo.svg" width="280" alt="Bonsai"> </p> <p align="center"> <a href="https://prismml.com"><b>Prism ML Website</b></a> &nbsp;|&nbsp; <a href="https://github.com/PrismML-Eng/Bonsai-demo/blob/main/bonsai-2-27b-whitepaper.pdf"><b>


发布时间:2026-09-26 05:58
抓取时间:2026-09-24 13:06
来源机构:Hugging Face
阅读原文huggingface.co