返回全部动态
llama.cpp b10728 发布:CUDA Flash Attention 优化
原标题:b10728
AI 摘要
llama.cpp 发布 b10728 版本,主要更新为 CUDA 后端中 Flash Attention 的 XOR swizzle 优化,将 K/V 共享内存改为 fp16 瓦片,并修复了 DGX Spark 上的共享内存竞争问题。该版本提供了多平台预编译二进制文件,包括 macOS、Linux、Windows、Android 等。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
<details open> CUDA: XOR swizzle flash attn K,V smem fp16 tiles (#25635) * CUDA: XOR swizzle flash attn K,V smem fp16 tiles Signed-off-by: ynankani <ynankani@nvidia.com> * Fix use 64bit generic pointer instead of 32bit shared pointer Signed-off-by: ynankani <ynankani@nvidia.com> * fix shared memory race in FA on DGX Spark * Handle corener case Signed-off-by: ynankani <ynankani@nvidia.com> * Add swizzle test cases and gate sync for swizzled path only Signed-off-by: ynankani <ynankani@
发布时间:2026-09-01 05:46
抓取时间:2026-09-01 05:51
来源机构:ggml-org