SGLang v0.5.11 发布:CUDA 13 升级、推测解码 V2 默认启用,新增多模型支持
SGLang 发布 v0.5.11 版本,默认 CUDA 版本升级至 13.0,PyTorch 升级至 2.11,并默认启用 Speculative Decoding V2 以降低 CPU 开销。该版本新增了对 Gemma 4、GLM-5.1、Qwen3.6、MiMo-V2.5、Kimi-K2.6 等新模型的支持,并增强了 PD 分离场景下的解码端 Radi
公司与模型 · 智谱的 GLM 系列模型动态:旗舰开源发布、代码与推理能力迭代、商业化与生态
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 18:14
SGLang 发布 v0.5.11 版本,默认 CUDA 版本升级至 13.0,PyTorch 升级至 2.11,并默认启用 Speculative Decoding V2 以降低 CPU 开销。该版本新增了对 Gemma 4、GLM-5.1、Qwen3.6、MiMo-V2.5、Kimi-K2.6 等新模型的支持,并增强了 PD 分离场景下的解码端 Radi
百度千帆平台于2026年3月13日发布多项更新,包括新增多款Qwen3.5多模态模型、支持GLM-5和Kimi-K2.5的TPM配额购买,并升级Coding Plan至Kimi-K2.5且支持MiniMax-M2.5。同时,AI助手升级为智能调度模式,提供多模态问答能力,并新增百度热搜、百度搜索MCP版等工具。
本文回顾了2026年1月至2月期间发布的10个开源权重LLM,重点比较了它们的架构异同。主要发布包括Arcee AI的Trinity Large、Moonshot AI的Kimi K2.5、StepFun Step 3.5 Flash、Qwen3-Coder-Next、z.AI的GLM-5、MiniMax M2.5、Nanbeige 4.1 3B、Qwen
百度千帆平台在2026年2月13日更新,新增GLM-5、Kimi-K2.5、MiniMax-M2.1深度思考模型,并支持自主规划Agent一键发布为秒哒插件,同时上线OpenClaw快速体验页面,新用户部署成功可获200元代金券。此外,工具广场推出AI论文功能,由百度文库、网盘与千帆团队联合打造,可一键将大纲扩展为高质量正文,提效50%以上。