返回全部动态
llama.cpp b10427 发布:SYCL 融合优化提升推理速度
原标题:b10427
AI 摘要
llama.cpp 发布 b10427 版本,主要更新为在 SYCL 后端融合了 q4_K 密集 FFN 的 mul_mat(gate)、mul_mat(up) 和 GLU 操作。在 Arc Pro B70 上,qwen2.5-3B 和 gemma-2-2b 的推理速度分别提升 2.8% 和 2.0%,批处理场景下最高提升 12.4%。该版本同时提供了多平台二进制文件下载。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
<details open> sycl: fuse mul_mat(gate) + mul_mat(up) + GLU for q4_K dense FFN (#26779) Measured on Arc Pro B70 (Battlemage, Level Zero), llama-bench -r 20, two interleaved rounds, tg128: qwen2.5-3B-Instruct Q4_K_M 154.18 -> 158.53 t/s +2.8% gemma-2-2b-it Q4_K_M 162.45 -> 165.62 t/s +2.0% llama-batched-bench on qwen2.5-3B, S_TG by batch size: B=1 142.72 -> 147.57 t/s +3.4% B=2 243.72 -> 268.26 t/s +10.1% B=4 359.58 -> 398.02 t/s +10.7%
发布时间:2026-08-14 16:14
抓取时间:2026-08-14 16:40
来源机构:ggml-org