返回全部动态

llama.cpp b10718 发布:CUDA MoE 融合扩展至多 token

原标题:b10718

llama.cpp Releases一手来源产品发布质量 76

AI 摘要

llama.cpp 发布 b10718 版本,主要更新是将 CUDA 上的 MoE 融合扩展到 specdec 场景,此前 MOE glu 融合和 topk-router 融合仅限于单 token,现在支持多 token,并新增 SWIGLU_CLAMP 案例。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的二进制文件。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

<details open> CUDA: extend MOE fusion to specdec, earlier MOE glu fusion and topk-router fusion were restricted to 1 token (#27621) * CUDA: extend MOE fusion to specdec, earlier MOE glu fusion and topk-router fusion were resticted to 1 token Signed-off-by: ynankani <ynankani@nvidia.com> * Address review comments Signed-off-by: ynankani <ynankani@nvidia.com> * Add SWIGLU_CLAMP case to multi-token moe fusion Signed-off-by: ynankani <ynankani@nvidia.com> --------- Signed-off-by: ynankani


发布时间:2026-08-31 22:22
抓取时间:2026-08-31 22:23
来源机构:ggml-org
阅读原文github.com