返回全部动态

llama.cpp b11168:Hexagon 动态量化器改进

原标题:b11168

llama.cpp Releases一手来源开源质量 73

AI 摘要

llama.cpp 发布 b11168 版本,主要针对 Hexagon NPU 后端进行动态量化器改进。改动包括修复 Q8_0 N=1 MUL_MAT 的精度问题、解决寄存器溢出、在所有动态量化路径中改用 DMA,并清理了过时的 run_quant_task 与相关非 DMA 激活逻辑。该更新由高通与 Hugging Face 的贡献者共同完成,旨在提升骁龙平台 Hexagon NPU 上的矩阵乘法推理效率与准确性。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

<details open> hexagon: dynamic quantizer improvements (#29395) * hexagon: fix accuracy issue in Q8_0 N=1 MUL_MAT * hex-quant: fix register spills * hex-mm: use dma for all dyn.quant paths Co-authored-by: Aparna M P <aparmp@qti.qualcomm.com> * hex-mm: remove obsolete run_quant_task * hex-mm: update tracing to properly wrap the events * hex-mm: use act for activation data in all paths * hex-mm: use act_ instead of src1_ to avoid confusion in fused kernels * hex-mm: remove/reroute the re


发布时间:2026-09-25 05:43
抓取时间:2026-09-25 06:17
来源机构:ggml-org
阅读原文github.com