llama.cpp b11111:新增 Intel Xe Vulkan 闪存注意力优化内核
原标题:b11111
AI 摘要
llama.cpp 发布 b11111 版本,主要更新为在 Vulkan 后端新增 Intel Xe 闪存注意力(flash attention)优化内核,覆盖 Xe-LPG Plus、Xe2、Xe3 架构,并针对 split k 路径做优化。同时更新主机端代码以支持 Intel split k FA 内核路径选择,修复 A770 Linux 上的算子测试失败,并在 flash_attn_decode_phase_1 着色器中改用对称 coopMatMulAdd() 以解决 26.2.3 mesa 驱动下的测试失败。该版本同步提供 macOS、Linux、Windows、Android 等多平台预编译二进制包。
正文节选
<details open> vulkan: add Intel Xe flash attention optimization kernels (2/3, Xe-LPG Plus/Xe2/Xe3) (#24406) * vulkan : Intel FA kernel optimization for split k path * vulkan : Host code update for Intel split k FA kernel path selection, fix A770 Linux op test failures * vulkan : use symmetric coopMatMulAdd() in flash_attn_decode_phase_1 shader to resolve test op failre on A770 Linux with 26.2.3 mesa driver * vulkan : fix editorconfig issue in flash_attn_decode_phase_2.comp --------- Co-a