vLLM v0.22.1 发布:新增 Mellum v2 支持与 Zen CPU 优化
vLLM 发布 v0.22.1 补丁版本,包含 8 个提交,来自 6 位贡献者。该版本新增对 JetBrains Mellum v2 模型的支持,并在 AMD Zen CPU 上通过 zentorch 加速量化线性推理,同时修复了多节点 Ray 数据并行服务、DeepSeek-V4 初始化等问题。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1731 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
vLLM 发布 v0.22.1 补丁版本,包含 8 个提交,来自 6 位贡献者。该版本新增对 JetBrains Mellum v2 模型的支持,并在 AMD Zen CPU 上通过 zentorch 加速量化线性推理,同时修复了多节点 Ray 数据并行服务、DeepSeek-V4 初始化等问题。
vLLM 发布 v0.22.0 版本,包含 459 个提交,来自 230 位贡献者。该版本重点提升了 DeepSeek V4 的成熟度,包括新增 NVFP4 融合 MoE 支持、CUDA 图优化和 MTP 投机解码。同时,Model Runner V2 成为 Qwen3 稠密模型的默认选项,并引入了实验性的 Rust 前端。性能方面,批量不变推理通过 Cut
DSPy 发布 3.3.0b1 测试版,引入新模块 ReActV2 和类型化的 BaseLM 系统,并更新 GEPA 至 0.1.1,同时减少框架依赖。ReActV2 支持原生工具调用和并行工具调用,可降低最高 50% 的成本;BaseLM 提供类型化的 LMRequest/LMResponse 接口,为未来 LiteLLM 解耦做准备。此外,numpy 变
SGLang 发布 v0.5.12.post1 稳定性补丁,包含 12 个修复,主要针对 DeepSeek V4 系列问题,如 B200/B300 上的解码乱码、EAGLE/MTP 崩溃、NSA 预填充调度器崩溃等,并修复了 PD 分离、HiSparse 精度等问题。性能方面优化了冷启动延迟和 JIT 编译成本。
Dify 发布 v1.14.2 补丁版本,重点进行安全加固、工作流可靠性提升、知识库稳定性修复以及部署和运行时调优。该版本加强了租户隔离和工具凭证安全,修复了工作流执行、RAG 管道和知识库的多个问题,并升级了插件守护进程和依赖。这些改进增强了 Dify 平台的安全性和稳定性,为后续的 Agent 功能奠定基础。
SGLang v0.5.12 发布,重点支持 DeepSeek V4 的完整推理路径,包括多种并行策略、硬件适配、预填充-解码分离、HiSparse 和 HiCache 等特性,并新增多个模型支持如 Intern-S2-Preview、MiniCPM-V 4.6 等。此外,还集成了 TokenSpeed MLA 注意力后端,优化了 FP4 低延迟性能,并迁移
本文回顾了近期开源大语言模型在长上下文效率方面的架构创新,重点分析了Gemma 4的KV共享与逐层嵌入、Laguna XS.2的逐层注意力预算、ZAYA1的压缩卷积注意力以及DeepSeek V4的mHC与压缩注意力。这些设计旨在减少KV缓存大小和内存开销,以支持更长的上下文和推理模型。文章指出,这些改动虽看似微小,但涉及Transformer块、残差流和注
vLLM 发布 v0.21.0 版本,包含 367 个提交,来自 202 位贡献者。该版本正式弃用 transformers v4,要求 C++20 编译器,并引入 KV 卸载与混合内存分配器集成、推理预算感知的投机解码、Blackwell 上的 TOKENSPEED MLA 后端等新特性。同时新增多种模型架构支持,并在性能、硬件支持(如 AMD ROCm、
Berkeley AI Research Blog 发表文章,探讨自适应并行推理作为高效推理扩展的新范式。文章指出,现有并行推理方法(如自一致性、树搜索等)的并行结构由外部决定,而自适应方法让模型自主决定何时分解任务、并行线程数及协调方式。文章分析了 ParaThinker、GroupThink、Hogwild! Inference 等近期方法,并强调不同问
Gemini API 于 2026 年 5 月 7 日发布 gemini-3.1-flash-lite 的正式版(GA),该模型针对速度、规模和成本效率进行了优化。同时,官方宣布 gemini-3.1-flash-lite-preview 预览版将于 2026 年 5 月 11 日弃用,并于 2026 年 5 月 25 日关闭。
SGLang 发布 v0.5.11 版本,默认 CUDA 版本升级至 13.0,PyTorch 升级至 2.11,并默认启用 Speculative Decoding V2 以降低 CPU 开销。该版本新增了对 Gemma 4、GLM-5.1、Qwen3.6、MiMo-V2.5、Kimi-K2.6 等新模型的支持,并增强了 PD 分离场景下的解码端 Radi
DSPy 发布了 3.2.1 版本,主要移除了对 litellm 的上限限制,并修复了异步流式调用和 Embedder 缓存问题。同时更新了文档和 CI 流程,包括部署文档调整和 TestPyPI 发布验证强化。该版本还更新了多个依赖,并新增了两位贡献者的首次贡献。
智谱AI于2026年3月15日发布了GLM-5-Turbo基座模型,该模型针对OpenClaw龙虾场景进行了深度优化,强化了外部工具调用和多步任务稳定性,提升了复杂指令拆解、多智能体协同、时间理解及长任务执行效率。该模型旨在提升数据吞吐量大、逻辑链条长的任务处理能力。
百度千帆平台于2026年3月13日发布多项更新,包括新增多款Qwen3.5多模态模型、支持GLM-5和Kimi-K2.5的TPM配额购买,并升级Coding Plan至Kimi-K2.5且支持MiniMax-M2.5。同时,AI助手升级为智能调度模式,提供多模态问答能力,并新增百度热搜、百度搜索MCP版等工具。
MLX 发布了 v0.31.1 补丁版本,包含多项 CUDA 内核优化(如量化 GEMV、Hadamard 变换、SegmentedMM)、混合分片(Hybrid sharding)支持、bug 修复及文档改进。该版本提升了 GPU 上的计算性能与稳定性,并新增了 bartlett 函数。
LlamaIndex 发布 v0.14.16 版本,包含多个核心修复和新功能,如新增令牌桶和滑动窗口限流器、多模态 LLM 重排序器、扩展向量存储元数据过滤器,并修复了多个 bug 和安全问题(CWE-502)。同时更新了多个集成包,包括 OpenAI、Anthropic、Bedrock 等,新增对 gpt-5-chat 和 reasoning conten
Google DeepMind 发布了 Gemini 3.1 Flash-Lite,这是 Gemini 3 系列中速度最快、成本效益最高的模型,专为大规模高吞吐量开发者工作负载设计。该模型定价为每百万输入 token 0.25 美元、每百万输出 token 1.5 美元,性能优于 2.5 Flash,输出速度提升 45%,首 token 时间快 2.5 倍。
Gemini API 于 2026 年 2 月 26 日发布 Nano Banana 2 和 Gemini 3.1 Flash 图像预览版,后者为高效模型,针对速度和大量使用场景优化。同时宣布 Gemini 3 Pro 预览版将于 2026 年 3 月 9 日关闭。
百度千帆平台在2026年2月13日更新,新增GLM-5、Kimi-K2.5、MiniMax-M2.1深度思考模型,并支持自主规划Agent一键发布为秒哒插件,同时上线OpenClaw快速体验页面,新用户部署成功可获200元代金券。此外,工具广场推出AI论文功能,由百度文库、网盘与千帆团队联合打造,可一键将大纲扩展为高质量正文,提效50%以上。
MLX 发布了 v0.30.6 版本,主要亮点是在 macOS 26.3 及以上版本中通过 JACCL 实现了更快的带宽。此外,该版本修复了多个问题,包括 WSL 中的托管内存、非 simd f16 构建、M2 以下芯片的 2pass sdpa、小 N 的 qmv impl 以及多设备 CUDA 的补丁。