返回全部动态
llama.cpp b10877 发布:优化 RDNA3 上 MoE 推理性能
原标题:b10877
AI 摘要
llama.cpp 发布 b10877 版本,主要更新为 CUDA 后端针对 RDNA3 架构的 MoE 模型推理优化,通过根据典型专家宽度调整 MMQ 的 N-tiles 大小来提升性能。该版本提供了多平台预编译二进制文件,包括 macOS、Linux、Windows、Android 等。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
<details open> CUDA: size routed MoE MMQ N-tiles from typical expert width on RDNA3 (#28552) Recreated from #24546 --------- Co-authored-by: Carl Philipp Klemm <carl@uvos.xyz> * CUDA: pick MMQ tile size against ncols_opt set on the host side Assisted-by: Claude Fable 5.1 Claude-Session: https://claude.ai/code/session_011SYPfRhKoUpU3gMsGxq6go --------- Co-authored-by: ravel7524 <58877666+ravel7524@users.noreply.github.com> Co-authored-by: Carl Philipp Klemm <carl@uvos.xyz> </details> **
发布时间:2026-09-09 20:53
抓取时间:2026-09-09 21:40
来源机构:ggml-org