后训练三值化扩展至 Qwen3-8B:能力保留、无损打包与执行
原标题:Scaling Post-Training Ternarisation to Qwen3-8B Capability Retention, Reproduction, Lossless Packing, and Packed Execution
AI 摘要
OneBit AI 发布技术研究报告,将后训练三值化(ternarization)流水线从 Qwen3-4B 扩展到 Qwen3-8B,采用 KOTMS 旋转、E2M-ATQ 自适应三值化和 GPTQ 式误差补偿的权重-only A16 配置。8B 模型在三语料困惑度比为 1.361,八项零样本任务平均准确率 64.6%(FP16 为 72.4%),机会校正保留率 78.5%,优于匹配 4B 运行的 69.6%。打包检查点为 8.24 GiB 且保持困惑度,直接打包执行达 15.52 tokens/s,但打包 GEMV 仍慢于 FP16 cuBLAS。
正文节选
Scaling Post-Training Ternarization to Qwen3-8B Capability Retention, Reproduction, Lossless Packing, and Packed Execution OneBit AI – Technical Research Report A scale-up study of aggressive post-training low-bit conversion on a single RTX 5070. Anirudh Malik | Poojith Devan | M Sparsh Mehra OneBit AI | Technical Research Report | September 2026 Keywords: post-training quantization, ternary quantization, 1.58-bit LLMs, Qwen3, GPTQ, packed inference, low-bit kernels, deployment efficiency Abstra