返回全部动态

SGLang 发布 v0.5.15.post1 补丁,修复 GLM 5.2 相关问题

原标题:v0.5.15.post1

SGLang Releases一手来源产品发布质量 79

AI 摘要

SGLang 发布了 v0.5.15.post1 补丁版本,主要针对 GLM 5.2 模型进行修复。修复内容包括 DSA 模型在非 CUDA/HIP 设备上的启动问题、flashinfer 在 CUDA 12 镜像上的依赖问题、长输入下 FP4 MoE 内核导致的 NaN 输出,以及 GLM 5.2 在 PD 分离和上下文并行设置下的 IndexShare 问题。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

v0.5.15.post1 includes a few patches, mostly for GLM 5.2 - #30454 #30627: Fix DSA model launching on non Cuda/HIP devices - #30858: Fix flashinfer dependency on Cuda 12 images - #31001: Fix NaN outputs caused by flashinfer trtllm FP4 MoE kernels on long input - #30839: Fix GLM 5.2 IndexShare on PD disaggregation setting - #30992: Fix GLM 5.2 IndexShare on Context Parallel setting


发布时间:2026-07-14 16:43
抓取时间:2026-08-02 00:31
来源机构:SGLang
阅读原文github.com