返回全部动态

llama.cpp b10702 发布:优化 HIP Q2_0 点积性能

原标题:b10702

llama.cpp Releases一手来源产品发布质量 72

AI 摘要

llama.cpp 发布 b10702 版本,主要针对 HIP 后端优化了 Q2_0 量化格式的点积路径,特别为 gfx1201 架构使用原生 amdgcn perm 指令提升性能。该版本提供了多平台预编译二进制,包括 macOS、Linux、Windows、Android 等,并支持多种后端如 CUDA、Vulkan、ROCm 等。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

<details open> hip : optimize Q2_0 dot-product path for gfx1201 (#26753) * hip/gfx1201: optimize q2_0 vec_dot_q2_0_q8_1 with native amdgcn perm * Broadened HIP's Q2_0 perm optimization * Remove redundant HIP perm availability guard * Optimize HIP Q2_0 MMQ unpack with native perm * cuda: label HIP preprocessor guard * cuda: label HIP preprocessor guard * Restore MMQ tile index handling </details> **Website:** - <https://llama.app> **Attestations:** - <https://github.com/ggml-org/llama.


发布时间:2026-08-31 05:20
抓取时间:2026-08-31 05:32
来源机构:ggml-org
阅读原文github.com