vLLM v0.27.0 发布:支持 Kimi K3、Qwen3.5,性能大幅提升
vLLM 发布 v0.27.0 版本,包含 561 个提交,来自 242 位贡献者。该版本新增对 Kimi K3、Qwen3.5、K-EXAONE-2.0 等模型的支持,并升级至 PyTorch 2.13.0,深化 FlashAttention 4 集成,优化 DeepSeek-V4 性能,扩展 Model Runner V2 至非生成任务,并引入容错框架和
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1724 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
vLLM 发布 v0.27.0 版本,包含 561 个提交,来自 242 位贡献者。该版本新增对 Kimi K3、Qwen3.5、K-EXAONE-2.0 等模型的支持,并升级至 PyTorch 2.13.0,深化 FlashAttention 4 集成,优化 DeepSeek-V4 性能,扩展 Model Runner V2 至非生成任务,并引入容错框架和
AX1Y2JP 发布了 MiniMax-H3 的量化版本,基于 Comfy-Org/MiniMax-H3,采用 W4A8 量化,并支持 ComfyUI 原生运行。该模型在 4070Ti 上展示了示例结果,用户需使用最新版 ComfyUI 和 comfy-kitchen,并重新下载更新后的模型。
llama.cpp 发布 b10344 版本,主要新增了对 Nemotron 模型的多 token 预测(MTP)支持,并引入了 mtp flags 配置。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,方便用户部署。
llama.cpp 发布了 b10343 版本,主要更新是将 cpp-httplib 库升级至 0.53.0。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。
gkraker04 发布了 Nanbeige4.2-3B 模型的 GGUF 量化版本,该模型基于 Looped Transformer 架构,专为 buun-llama-cpp 运行时设计。量化使用重要性矩阵引导,提供从 Q8 0 到 IQ2 XS 的多种精度,并附有 MMLU-Pro 和 MuSR 基准测试结果,显示 Q4 K M 在质量与体积间达到最佳平
Meta 发布了 Muse Glimmer,一个 30B 参数的开源稠密模型,支持 120K+ 上下文窗口,专为本地 AI 代理工作流设计。该模型在 NVIDIA 的 GPU 平台上优化运行,单 GPU 可实现每秒 20K tokens 的吞吐量,支持全本地推理,无需模型分片或外部端点。NVIDIA 提供了多种部署选项,包括 GeForce RTX 5090
该研究识别了硬提示压缩中的一种结构性失败模式——指称悬空,即独立选择可能拆分依赖证据对,保留答案但删除解释所需的实体。在0.30压缩比下,Beaver在三个多跳问答数据集上的悬空率为34-54%,所有六种测试压缩器在HotpotQA上均表现出高达60%的悬空率。重新插入缺失的支持段落可将准确率提高29-34个百分点,而自动恢复探针在压缩比仅增加0.01的情况
llama.cpp 新增 Granite-Switch 架构后端,支持带多个 LoRA 适配器的模型,通过控制 token 实现逐 token 切换。该实现采用路由注意力机制在图中恢复适配器索引,解决了并发序列隔离问题,但存在单序列内无法回退的已知限制。目前支持 CPU 和 Mac (Metal) 构建,并已通过相关测试。
twaggs88 发布了 DeepSeek-V4-Flash-0731 的 GGUF 量化版本,这是一个 284B 参数的 MoE 模型,通过 IQ2 XXS MMQ、MXFP4 和 MXFP8 等量化技术压缩至 92GB,可在 NVIDIA GB10 设备上全量运行。该版本包含完整的 256 个专家,并集成了 DSpark 投机解码草稿模型,支持长上下文和
llama.cpp 发布 b10338 版本,修复了模型保存时共享专家 FFN 长度键被覆盖的 bug,该问题导致 MoE 模型(如 qwen2moe、granite-moe 等)在保存后无法重新加载。修复后,共享专家和分块 FFN 长度均能正确保存,并添加了相应测试。
DreamFast 发布了基于 Google Gemma 3 12B IT 的 abliterated 版本 Heretic v2,通过 Heretic v1.3.0 减少模型拒绝行为,同时保持质量,并针对视频生成模型 LTX-2 优化。该模型提供 FP8、INT8 (ConvRot)、NVFP4、MXFP8 和 GGUF 等多种量化格式,支持从 Ada 到
llama.cpp 发布 b10336 版本,主要重构了多个 WebGPU 的 WGSL 文件并简化了 flash attn 的 WGSL 实现。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
OpenAI 报告部分 ChatGPT 用户遇到错误增加,已确认问题并实施缓解措施,目前所有受影响服务已完全恢复,正在监控恢复情况。
arXiv 论文提出 TEXAS 方法,用于混合专家(MoE)大语言模型的下游适配。该方法通过对比成功与失败实例上的专家激活,识别任务相关专家,并在微调时对失败实例中激活这些专家的答案 token 赋予更高权重。在三个 MoE 模型和六个基准上,TEXAS 在 18 个设置中的 17 个达到最佳或并列最佳,平均比最强基线提升 1.3-1.5 分。
本文提出LivePlan框架,用于实时监控和纠正编程代理在解决GitHub问题时的行为低效和偏离。LivePlan将判断与建议解耦,使用确定性规则监控器检测问题,仅在检测到问题时才调用顾问LLM进行下一步纠正。在SWE-bench Verified和SWE-bench Pro上,LivePlan将问题解决率提升最高15.2%,平均提升9.9%,额外成本仅每实
arXiv 发表了一项关于生成式跨域推荐的研究,提出了 HD-Rec 框架。该框架采用分层域感知量化器,结合全局共享的粗粒度码本和自适应路由的细粒度码本,并引入域自适应稀疏专家混合模块,以提升跨域推荐性能。实验表明,HD-Rec 在三个公开基准上优于现有基线。
Jina AI 发布了 jina-reranker-v3,一个基于 Qwen3-0.6B 的 0.6B 参数多语言文档重排序模型,采用新颖的 last but not late interaction 架构,在 131K token 上下文中可同时处理多达 64 个文档。该模型在 BEIR 基准上达到 61.94 nDCG@10 的 SOTA 性能,比生成式
Modular TTT 提出了一种将测试时训练(TTT)表示为可组合模块的框架,通过有向无环图表示内部学习器,并将快速权重网络、损失函数、学习率、权重衰减和归一化作为显式设计维度。系统消融发现,小的学习率初始化、权重衰减和单层非线性可提升性能,而更深的快速权重网络和归一化会因激活值过大而损害性能。基于这些发现训练的 410M 和 1.45B 参数模型在 10
墨芯人工智能成立稀疏计算产学研联盟,联合高校与产业伙伴推动稀疏计算产业化。联盟将基于6S技术架构,从能效突破、研发转化、生态赋能三方面推进,以应对AI Token经济带来的算力挑战。此举旨在将稀疏计算从‘小众先锋’推向‘主流选择’,降低算力成本。
Deepwen 3.6 是基于 Qwen3.6-35B-A3B 的微调模型,融合了 DeepSeek-V4-Flash-0731 的推理能力,专注于 AAA 游戏开发、3D 生成和 Web 图形。该模型提供了多种 MoQ 量化版本,并附带多模态投影器。其改进包括程序化生成、硬表面建模、Blender 工作流等,且保留了 Qwen 的原始能力。