返回全部动态

后训练三值化扩展至 Qwen3-8B:能力保留、无损打包与执行

原标题:Scaling Post-Training Ternarisation to Qwen3-8B Capability Retention, Reproduction, Lossless Packing, and Packed Execution

arXiv cs.LG一手来源研究质量 75

AI 摘要

OneBit AI 发布技术研究报告,将后训练三值化(ternarization)流水线从 Qwen3-4B 扩展到 Qwen3-8B,采用 KOTMS 旋转、E2M-ATQ 自适应三值化和 GPTQ 式误差补偿的权重-only A16 配置。8B 模型在三语料困惑度比为 1.361,八项零样本任务平均准确率 64.6%(FP16 为 72.4%),机会校正保留率 78.5%,优于匹配 4B 运行的 69.6%。打包检查点为 8.24 GiB 且保持困惑度,直接打包执行达 15.52 tokens/s,但打包 GEMV 仍慢于 FP16 cuBLAS。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

Scaling Post-Training Ternarization to Qwen3-8B Capability Retention, Reproduction, Lossless Packing, and Packed Execution OneBit AI – Technical Research Report A scale-up study of aggressive post-training low-bit conversion on a single RTX 5070. Anirudh Malik | Poojith Devan | M Sparsh Mehra OneBit AI | Technical Research Report | September 2026 Keywords: post-training quantization, ternary quantization, 1.58-bit LLMs, Qwen3, GPTQ, packed inference, low-bit kernels, deployment efficiency Abstra


发布时间:2026-09-10 12:00
抓取时间:2026-09-10 12:04
来源机构:arXiv
阅读原文arxiv.org