返回全部动态

llama.cpp b10728 发布:CUDA Flash Attention 优化

原标题:b10728

llama.cpp Releases一手来源产品发布质量 72

AI 摘要

llama.cpp 发布 b10728 版本,主要更新为 CUDA 后端中 Flash Attention 的 XOR swizzle 优化,将 K/V 共享内存改为 fp16 瓦片,并修复了 DGX Spark 上的共享内存竞争问题。该版本提供了多平台预编译二进制文件,包括 macOS、Linux、Windows、Android 等。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

<details open> CUDA: XOR swizzle flash attn K,V smem fp16 tiles (#25635) * CUDA: XOR swizzle flash attn K,V smem fp16 tiles Signed-off-by: ynankani <ynankani@nvidia.com> * Fix use 64bit generic pointer instead of 32bit shared pointer Signed-off-by: ynankani <ynankani@nvidia.com> * fix shared memory race in FA on DGX Spark * Handle corener case Signed-off-by: ynankani <ynankani@nvidia.com> * Add swizzle test cases and gate sync for swizzled path only Signed-off-by: ynankani <ynankani@


发布时间:2026-09-01 05:46
抓取时间:2026-09-01 05:51
来源机构:ggml-org
阅读原文github.com