返回全部动态
llama.cpp b10981:优化 OpenVINO 有状态解码与 GPU MoE 推理
原标题:b10981
AI 摘要
llama.cpp 发布 b10981 版本,主要针对 OpenVINO 后端进行优化,涵盖有状态解码、GPU MoE 推理、KV 状态重排、RoPE 与归一化翻译等。修复了 Gemma-4 等模型因逐层 KV 头数/头尺寸差异导致解码乱码的问题,并拒绝无法从 KV 状态恢复的有状态解码。性能上,GPU 上 gemma-4-12B 在深度 8192 时从 6.27 提升至 9.11 t/s,Llama-3.2-1B 从 47.8 提升至 59.6 t/s。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
<details open> OpenVINO: optimize stateful decode and GPU MoE inference (#28638) * exclude GPU/NPU failing POOL_2D case * Fix pool case * ggml-openvino: fix stateful decode for Gemma-4 per-layer-type head sizes * ggml-openvino: fix MSVC narrowing error in permute * ggml-openvino: classify sliding-window layers structurally on interleaved-SWA models * ggml-openvino: add GGML_OPENVINO_REQUANT_KQUANT to select a 4-bit requant target * ggml-openvino: add GGML_OPENVINO_SPILL_DIR to spill weig
发布时间:2026-09-15 20:00
抓取时间:2026-09-15 20:08
来源机构:ggml-org