返回全部动态
SGLang 发布 v0.5.15.post1 补丁,修复 GLM 5.2 相关问题
原标题:v0.5.15.post1
AI 摘要
SGLang 发布了 v0.5.15.post1 补丁版本,主要针对 GLM 5.2 模型进行修复。修复内容包括 DSA 模型在非 CUDA/HIP 设备上的启动问题、flashinfer 在 CUDA 12 镜像上的依赖问题、长输入下 FP4 MoE 内核导致的 NaN 输出,以及 GLM 5.2 在 PD 分离和上下文并行设置下的 IndexShare 问题。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
v0.5.15.post1 includes a few patches, mostly for GLM 5.2 - #30454 #30627: Fix DSA model launching on non Cuda/HIP devices - #30858: Fix flashinfer dependency on Cuda 12 images - #31001: Fix NaN outputs caused by flashinfer trtllm FP4 MoE kernels on long input - #30839: Fix GLM 5.2 IndexShare on PD disaggregation setting - #30992: Fix GLM 5.2 IndexShare on Context Parallel setting
发布时间:2026-07-14 16:43
抓取时间:2026-08-02 00:31
来源机构:SGLang