Prism ML 发布三值量化 Bonsai 2 27B GGUF 模型
原标题:prism-ml/Ternary-Bonsai-2-27B-gguf
AI 摘要
Prism ML 在 Hugging Face 发布 Bonsai 2 27B 的 GGUF 版本,基于 Qwen3.8-27B 架构,将全部语言权重(嵌入、注意力投影、MLP 投影、LM head)量化为三值 {-1,0,+1},以约 1.72 bits/weight 存储,模型体积约 5.95 GB(PTQ1_0)或 7.21 GB(PQ2_0),相比 FP16 缩小约 9.3 倍。官方称保留 98.2% 的 FP16 智能水平,在 14 项思考模式基准上平均 84.78,并支持 262K 上下文、思考/推理/工具调用行为,可在 llama.cpp(CUDA、Metal、CPU)上运行,Apple M5 Max 笔记本上约 47 tok/s。
正文节选
--- license: apache-2.0 library_name: llama.cpp pipeline_tag: text-generation tags: - ternary - 2-bit - gguf - llama-cpp - cuda - metal - on-device - hybrid-attention - prismml - bonsai base_model: - Qwen/Qwen3.8-27B --- <p align="center"> <img src="./assets/bonsai-logo.svg" width="280" alt="Bonsai"> </p> <p align="center"> <a href="https://prismml.com"><b>Prism ML Website</b></a> | <a href="https://github.com/PrismML-Eng/Bonsai-demo/blob/main/bonsai-2-27b-whitepaper.pdf"><b>