返回全部动态
llama.cpp b10615 发布:Metal flash-attn 按设备调优
原标题:b10615
AI 摘要
llama.cpp 发布 b10615 版本,主要针对 Metal 后端为 flash-attn 向量计算添加了按设备调优的 (Q, NE) 参数,并新增了调优工具和表格,覆盖 M1 Pro、M2 Ultra、M5 Max 等设备。该版本同时提供了多平台二进制包,包括 macOS、Linux、Windows、Android 等。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
<details open> metal : per-device tuned (Q, NE) for flash-attn vec (#26570) * metal : per-device tuned (Q, NE) for flash-attn vec (#25750) * rebase Q-generic FA vec body from 01dc93607 (#23114) * add 53 f16 (Q,NE) flash-attn vec instantiations (vec 80 -> 133) * add FA vec (Q,NE) tuning table + dispatch wiring + SMEM cap fallback * add FA vec (Q,NE) perf sweep * fill tuning result * fold family table into a per-family representative SKU * refactor tuning result format * extend FA vec t
发布时间:2026-08-25 05:53
抓取时间:2026-08-25 06:18
来源机构:ggml-org