返回全部动态

llama.cpp b11189:OpenCL 新增 Q5_K A8 二进制 GEMM 内核

原标题:b11189

llama.cpp Releases一手来源开源质量 68

AI 摘要

llama.cpp 发布 b11189 版本,主要变更是为 OpenCL 后端新增两个二进制 GEMM 内核(kernel_gemm_noshuffle_q5_k_f32_32b_trans_ila_a8_bin 和 kernel_gemm_noshuffle_q5_k_q8_1_dp4a_ila_a8_bin),分别覆盖非 dp4a 与 dp4a 的 A8 Q5_K 非 MoE 场景,并修复了二进制内核中 s 矩阵转置的问题。该提交由高通工程师 Li He 参与贡献,同时随版本发布了覆盖 macOS、Linux、Windows、Android 等多平台多后端的预编译二进制包。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

<details open> opencl: add bin kernel `kernel_gemm_noshuffle_q5_k_f32_32b_trans_ila_a8_bin`, `kernel_gemm_noshuffle_q5_k_q8_1_dp4a_ila_a8_bin` (#29401) * opencl: add A8 Q5_K non-MoE non dp4a + dp4a binary kernel * opencl: fix s transpose - s only transposed for bin kernels --------- Co-authored-by: Li He <lih@qti.qualcomm.com> </details> **Website:** - <https://llama.app> **Attestations:** - <https://github.com/ggml-org/llama.cpp/attestations/50281199> **macOS/iOS:** - [macOS Apple Sili


发布时间:2026-09-26 03:34
抓取时间:2026-09-26 04:00
来源机构:ggml-org
阅读原文github.com