返回全部动态

llama.cpp b10785 发布:Metal 稀疏注意力优化

原标题:b10785

llama.cpp Releases一手来源产品发布质量 83

AI 摘要

llama.cpp 发布 b10785 版本,主要新增 Metal 上的稀疏 Flash Attention 支持,通过索引压缩和单遍扫描优化了预填充阶段的性能,并修复了多行寻址问题。该版本还包含测试用例和性能测试,并提供了多平台二进制下载。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

<details open> metal : add sparse FA (#28098) * metal : support n_kv_max sparse mask hint in flash attention vec kernel - add kernel_flash_attn_ext_vec_idx: compacts finite mask entries into a per-row index list (Hillis-Steele scan, one threadgroup per row) - extend vec FA kernel with optional sparse index gathering (FC slot 5) - add host-side gate: sparse path when n_kv_max > 0, mask present, supported head sizes / KV types, n_kv_max <= 4096 - new buffer region extra_idx for the index li


发布时间:2026-09-03 20:19
抓取时间:2026-09-03 21:04
来源机构:ggml-org
阅读原文github.com