返回全部动态
vLLM v0.21.0 发布:弃用 transformers v4,新增多项性能优化
原标题:v0.21.0
AI 摘要
vLLM 发布 v0.21.0 版本,包含 367 个提交,来自 202 位贡献者。该版本正式弃用 transformers v4,要求 C++20 编译器,并引入 KV 卸载与混合内存分配器集成、推理预算感知的投机解码、Blackwell 上的 TOKENSPEED_MLA 后端等新特性。同时新增多种模型架构支持,并在性能、硬件支持(如 AMD ROCm、CPU、Intel XPU)和大型服务方面进行了大量优化。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
## Highlights This release features 367 commits from 202 contributors (49 new)! * **Transformers v4 deprecated**: This release formally deprecates `transformers` v4 support (#40389). Users should migrate to `transformers` v5. * **C++20 build requirement**: vLLM now requires a C++20-compatible compiler for compatibility with PyTorch (#40380). This is a **breaking build change**. * **KV Offload + Hybrid Memory Allocator (HMA)**: The KV offloading subsystem now integrates with the Hybrid Me
发布时间:2026-05-15 16:44
抓取时间:2026-08-02 00:23
来源机构:vLLM