返回全部动态
llama.cpp b10236 发布:Metal 实现 DSv4 Lightning Indexer 并优化性能
原标题:b10236
AI 摘要
llama.cpp 发布 b10236 版本,在 Metal 后端实现了 DeepSeek V4 的 Lightning Indexer 算子,支持 F16 键和多种量化缓存,并通过分阶段处理 K tiles 优化性能。基准测试显示,在长 KV 缓存下预填充速度显著提升(如 d30000 时从 33.40 提升至 49.18 t/s),同时提供了多平台二进制下载。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
<details open> metal: implement DSv4 Lightning Indexer (#25893) * metal: implement F16 Lightning Indexer - Implement GGML_OP_LIGHTNING_INDEXER for 128-dimensional, 64-head inputs with F32 queries and weights plus F16 keys and masks. - Add tiled and tail kernels and test KV lengths around 8- and 64-element boundaries. llama-bench (--mmap 1, -fa 1, -p 512, -n 128; d=0/10k/20k/30k): Before: - pp512: 153.73 ± 0.87 t/s - tg128: 8.91 ± 0.04 t/s - pp512 @ d10000: 73.90 ± 0.39 t/s - tg128 @ d10
发布时间:2026-08-03 13:11
抓取时间:2026-08-03 16:14
来源机构:ggml-org