Together AI 定制投机解码加速 DeepSeek-R1 推理
Together AI 在博客中展示了为 DeepSeek-R1 定制投机解码(speculative decoding)加速器的方法,通过基于客户工作负载微调,相比其基础加速器可实现 1.23-1.45 倍解码速度提升和约 25% 成本降低,相比传统逐 token 预测则达到 1.85-2.97 倍加速和约 55% 成本削减。该方法利用客户专用端点的数据分
公司与模型 · DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与能力的搅局者
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 19:03
Together AI 在博客中展示了为 DeepSeek-R1 定制投机解码(speculative decoding)加速器的方法,通过基于客户工作负载微调,相比其基础加速器可实现 1.23-1.45 倍解码速度提升和约 25% 成本降低,相比传统逐 token 预测则达到 1.85-2.97 倍加速和约 55% 成本削减。该方法利用客户专用端点的数据分
Together AI 发布了一项名为 ReasonIF 的新基准,用于评估大型推理模型(LRM)在推理过程中遵循用户指令的能力。研究发现,包括 GPT-OSS-120B、Qwen3-235B 和 DeepSeek-R1 在内的前沿模型,在推理过程中遵循指令的失败率超过 75%,且任务难度越高,遵循能力越差。该基准包含 300 道数学和科学问题,涵盖多语言、
llama.cpp 发布了 b10228 版本,主要更新是支持 DeepSeek V4 的 MTP(多 token 预测)和 DSpark 特性。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并包含 UI 组件。
llama.cpp 发布 b10217 版本,主要更新为在聊天功能中为 DeepSeek 模型启用工具调用(PR #26269)。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。
LMDeploy 发布 v0.15.0 版本,新增对 DeepSeek V4 的支持,并引入长上下文和 MTP 前缀缓存命中、推测解码的引导解码、内存分配器与调度器集成等特性。同时优化了 TTFT、流式响应解析、FP8 MoE 等性能,并修复了多项 bug,包括前缀缓存、Triton FP8 通信、多模态工具消息解析等。
NVIDIA 技术博客指出,相同硬件配置的 AI 集群因内核、虚拟机、BIOS 和 NCCL 等配置差异,训练吞吐量可相差 8%-12%。文章通过四个案例展示了如何利用 perf、Nsight Systems 等工具定位并解决性能瓶颈,例如启用 CMDQV/VCMDQ 修复虚拟化环境中的 SMMU 开销问题。这些诊断模式可帮助基础设施工程师在正式验证前优化集
vLLM 发布 v0.26.0 版本,包含 411 个提交,来自 212 位贡献者。新版本支持 Inkling 模型系列,并针对 DeepSeek-V4 进行了性能优化,包括专用路由内核和 fused topk bias 等。此外,引入了 fp32 lm head 选项、灵活的注意力后端选择,并增强了 KV 卸载和分层存储功能。Rust 前端新增多模态视频和
SGLang 发布 v0.5.16,包含 574 个 PR,来自 169 位贡献者。新特性包括 DSpark 置信度驱动的投机解码算法,在 DeepSeek-V4-Pro 上达到 383.7 tok/s;支持 975B 参数的 Inkling 多模态 MoE 模型;以及多项性能优化和模型支持。同时移除了实验性的 QServe 和 FBGEMM FP8 量化路
本文探讨了如何控制大语言模型(LLM)的推理努力程度,使其具备低、中、高多种推理模式。文章回顾了推理模型的发展,如OpenAI的o1和DeepSeek-R1,并介绍了通过强化学习(RLVR)训练推理模型的方法,以及推理时计算扩展的概念。作者还提到了GPT-5.6系列模型提供多种推理努力设置,并计划深入讲解多努力模式模型的开发方法。
vLLM 发布 v0.24.0 版本,包含 571 个提交,来自 256 位贡献者。新增 MiniMax-M3、DiffusionGemma 等模型支持,并持续优化 DeepSeek-V4 的性能。Model Runner V2 默认支持量化模型,Rust 前端新增多项 API 功能。设备选择机制改为使用 device ids 参数,不再内部设置 CUDA
SGLang v0.5.14 发布,新增对 GLM-5.2、LiquidAI LFM2.5、Kimi-K2.7-Code、DiffusionGemma 等模型的支持,并针对 DeepSeek-V4 在 NVIDIA GB300 上实现 5 倍吞吐提升。该版本还引入了 Waterfill 和 LPLB 两种 MoE 负载均衡方法,以及 KDA CuteDSL
Interconnects AI 播客邀请 Ai2 的 Finbarr Timbers 回顾前沿后训练配方,重点介绍了 2026 年出现的多教师在线蒸馏(MOPD)模式,该模式由 MiMo Flash v2 引入,并被 DeepSeek V4 和 Nemotron 3 Ultra 扩展至 10 多个教师模型。节目还梳理了从 InstructGPT 到 202
Spring AI 发布了 2.0.0-RC1 版本,包含多项新特性、错误修复和文档更新。新特性包括为 MessageWindowChatMemory 添加回合边界裁剪、移除模型默认值、将 advisors 移至独立模块、移除内部工具执行等。错误修复涉及流式处理、span 层级和 JSON schema 生成等问题。该版本旨在简化 API 并提升可维护性。
vLLM 发布 v0.22.1 补丁版本,包含 8 个提交,来自 6 位贡献者。该版本新增对 JetBrains Mellum v2 模型的支持,并在 AMD Zen CPU 上通过 zentorch 加速量化线性推理,同时修复了多节点 Ray 数据并行服务、DeepSeek-V4 初始化等问题。
vLLM 发布 v0.22.0 版本,包含 459 个提交,来自 230 位贡献者。该版本重点提升了 DeepSeek V4 的成熟度,包括新增 NVFP4 融合 MoE 支持、CUDA 图优化和 MTP 投机解码。同时,Model Runner V2 成为 Qwen3 稠密模型的默认选项,并引入了实验性的 Rust 前端。性能方面,批量不变推理通过 Cut
SGLang 发布 v0.5.12.post1 稳定性补丁,包含 12 个修复,主要针对 DeepSeek V4 系列问题,如 B200/B300 上的解码乱码、EAGLE/MTP 崩溃、NSA 预填充调度器崩溃等,并修复了 PD 分离、HiSparse 精度等问题。性能方面优化了冷启动延迟和 JIT 编译成本。
SGLang v0.5.12 发布,重点支持 DeepSeek V4 的完整推理路径,包括多种并行策略、硬件适配、预填充-解码分离、HiSparse 和 HiCache 等特性,并新增多个模型支持如 Intern-S2-Preview、MiniCPM-V 4.6 等。此外,还集成了 TokenSpeed MLA 注意力后端,优化了 FP4 低延迟性能,并迁移
SGLang 发布 v0.5.11 版本,默认 CUDA 版本升级至 13.0,PyTorch 升级至 2.11,并默认启用 Speculative Decoding V2 以降低 CPU 开销。该版本新增了对 Gemma 4、GLM-5.1、Qwen3.6、MiMo-V2.5、Kimi-K2.6 等新模型的支持,并增强了 PD 分离场景下的解码端 Radi
百度千帆平台于2025年12月19日发布多项更新,包括DeepSeek-R1模型支持前缀缓存,AI助手新增多模态功能(自动搜图、搜视频、音频和Markdown文件解析),工作流支持异步调用和导入导出,并推出百度天气和代码安全MCP服务。这些更新旨在提升开发效率和多模态知识复用能力。
Hugging Face 发布了文本生成推理库 TGI 的 v3.3.1 版本,主要更新包括升级到 Torch 2.7 和 CUDA 12.8,并针对 HPU 后端优化了预热逻辑,支持 Llama4 和 DeepSeek R1 模型,同时修复了 GPU UUID 计数和默认注意力路径崩溃等问题。