返回全部动态
llama.cpp b11126:Vulkan 新增 IQ4_XS 矩阵乘法内核
原标题:b11126
AI 摘要
llama.cpp 发布 b11126 版本,主要变更为在 Vulkan 后端新增 IQ4_XS 量化格式的 MMQ/MMV 矩阵乘法内核并做性能优化。优化过程中针对 Intel A770 上 MMVQ 出现 27.3% 的 tg 性能回退,选择在 Intel 设备上禁用 IQ4_XS 的 MMVQ。该版本同时提供覆盖 macOS、Linux、Windows、Android 等多平台多后端的预编译二进制包。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
<details open> vulkan: add IQ4_XS MMQ/MMV matmul kernels (#28415) * vulkan: optimize IQ4_XS matmul kernels Assisted-by: OpenAI Codex * vulkan: address IQ4_XS review nits - drop the dead LOAD_VEC_A != 8 branch in the IQ4_XS shmem load; iq4_xs is in lut_load_vec_a()'s "8" list, so that path is never generated - disable MMVQ for IQ4_XS on Intel (27.3% tg regression on A770) - remove a stray empty line in types.glsl Assisted-By: Claude Opus 5 <noreply@anthropic.com> </details> **Website:**
发布时间:2026-09-23 20:01
抓取时间:2026-09-23 20:25
来源机构:ggml-org