返回主题地图

DeepSeek

公司与模型 · DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与能力的搅局者

关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 19:03

相关与对比厂商作为比较对象、合作方或受影响主体,当前共 80 条。
8月3日周一 · 2 条
对比或关联对象命中实体:deepseek r1
Together AI Blog一手来源研究

Together AI 定制投机解码加速 DeepSeek-R1 推理

Together AI 在博客中展示了为 DeepSeek-R1 定制投机解码(speculative decoding)加速器的方法,通过基于客户工作负载微调,相比其基础加速器可实现 1.23-1.45 倍解码速度提升和约 25% 成本降低,相比传统逐 token 预测则达到 1.85-2.97 倍加速和约 55% 成本削减。该方法利用客户专用端点的数据分

对比或关联对象命中实体:deepseek r1
Together AI Blog一手来源研究

ReasonIF基准揭示大型推理模型在推理中指令遵循失败率高

Together AI 发布了一项名为 ReasonIF 的新基准,用于评估大型推理模型(LRM)在推理过程中遵循用户指令的能力。研究发现,包括 GPT-OSS-120B、Qwen3-235B 和 DeepSeek-R1 在内的前沿模型,在推理过程中遵循指令的失败率超过 75%,且任务难度越高,遵循能力越差。该基准包含 300 道数学和科学问题,涵盖多语言、

8月2日周日 · 1 条
对比或关联对象命中实体:deepseek v4
llama.cpp Releases一手来源产品发布

llama.cpp b10228 发布,支持 DeepSeek V4 MTP 与 DSpark

llama.cpp 发布了 b10228 版本,主要更新是支持 DeepSeek V4 的 MTP(多 token 预测)和 DSpark 特性。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并包含 UI 组件。

8月1日周六 · 1 条
对比或关联对象命中实体:deepseek
llama.cpp Releases一手来源产品发布

llama.cpp b10217 发布:为 DeepSeek 启用工具调用

llama.cpp 发布 b10217 版本,主要更新为在聊天功能中为 DeepSeek 模型启用工具调用(PR #26269)。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。

7月31日周五 · 2 条
对比或关联对象命中实体:deepseek v4
LMDeploy Releases一手来源产品发布

LMDeploy v0.15.0 发布:支持 DeepSeek V4 并优化推理性能

LMDeploy 发布 v0.15.0 版本,新增对 DeepSeek V4 的支持,并引入长上下文和 MTP 前缀缓存命中、推测解码的引导解码、内存分配器与调度器集成等特性。同时优化了 TTFT、流式响应解析、FP8 MoE 等性能,并修复了多项 bug,包括前缀缓存、Triton FP8 通信、多模态工具消息解析等。

对比或关联对象命中实体:deepseek v3
NVIDIA Technical Blog一手来源教程

NVIDIA Exemplar Cloud:解锁 AI 基础设施全性能的配置诊断经验

NVIDIA 技术博客指出,相同硬件配置的 AI 集群因内核、虚拟机、BIOS 和 NCCL 等配置差异,训练吞吐量可相差 8%-12%。文章通过四个案例展示了如何利用 perf、Nsight Systems 等工具定位并解决性能瓶颈,例如启用 CMDQV/VCMDQ 修复虚拟化环境中的 SMMU 开销问题。这些诊断模式可帮助基础设施工程师在正式验证前优化集

7月27日周一 · 1 条
对比或关联对象命中实体:deepseek v4
vLLM Releases一手来源产品发布

vLLM v0.26.0 发布:新增 Inkling 模型支持与 DeepSeek-V4 性能优化

vLLM 发布 v0.26.0 版本,包含 411 个提交,来自 212 位贡献者。新版本支持 Inkling 模型系列,并针对 DeepSeek-V4 进行了性能优化,包括专用路由内核和 fused topk bias 等。此外,引入了 fp32 lm head 选项、灵活的注意力后端选择,并增强了 KV 卸载和分层存储功能。Rust 前端新增多模态视频和

7月25日周六 · 1 条
对比或关联对象命中实体:deepseek v4 pro
SGLang Releases一手来源产品发布

SGLang v0.5.16 发布:新增 DSpark 解码与 Inkling 模型支持

SGLang 发布 v0.5.16,包含 574 个 PR,来自 169 位贡献者。新特性包括 DSpark 置信度驱动的投机解码算法,在 DeepSeek-V4-Pro 上达到 383.7 tok/s;支持 975B 参数的 Inkling 多模态 MoE 模型;以及多项性能优化和模型支持。同时移除了实验性的 QServe 和 FBGEMM FP8 量化路

7月18日周六 · 1 条
对比或关联对象命中实体:deepseek r1
Ahead of AI研究

控制LLM推理努力:多模式推理模型的开发方法

本文探讨了如何控制大语言模型(LLM)的推理努力程度,使其具备低、中、高多种推理模式。文章回顾了推理模型的发展,如OpenAI的o1和DeepSeek-R1,并介绍了通过强化学习(RLVR)训练推理模型的方法,以及推理时计算扩展的概念。作者还提到了GPT-5.6系列模型提供多种推理努力设置,并计划深入讲解多努力模式模型的开发方法。

6月30日周二 · 1 条
对比或关联对象命中实体:deepseek v4
vLLM Releases一手来源产品发布

vLLM v0.24.0 发布:新增 MiniMax-M3 与 DiffusionGemma 支持

vLLM 发布 v0.24.0 版本,包含 571 个提交,来自 256 位贡献者。新增 MiniMax-M3、DiffusionGemma 等模型支持,并持续优化 DeepSeek-V4 的性能。Model Runner V2 默认支持量化模型,Rust 前端新增多项 API 功能。设备选择机制改为使用 device ids 参数,不再内部设置 CUDA

6月27日周六 · 1 条
对比或关联对象命中实体:deepseek v4
SGLang Releases一手来源产品发布

SGLang v0.5.14 发布:新增多模型支持与 DeepSeek-V4 性能优化

SGLang v0.5.14 发布,新增对 GLM-5.2、LiquidAI LFM2.5、Kimi-K2.7-Code、DiffusionGemma 等模型的支持,并针对 DeepSeek-V4 在 NVIDIA GB300 上实现 5 倍吞吐提升。该版本还引入了 Waterfill 和 LPLB 两种 MoE 负载均衡方法,以及 KDA CuteDSL

6月16日周二 · 1 条
对比或关联对象命中实体:deepseek r1
Interconnects AI观点

前沿后训练配方回顾:MOPD 模式与 2026 年模型技术解析

Interconnects AI 播客邀请 Ai2 的 Finbarr Timbers 回顾前沿后训练配方,重点介绍了 2026 年出现的多教师在线蒸馏(MOPD)模式,该模式由 MiMo Flash v2 引入,并被 DeepSeek V4 和 Nemotron 3 Ultra 扩展至 10 多个教师模型。节目还梳理了从 InstructGPT 到 202

6月6日周六 · 1 条
对比或关联对象命中实体:deepseek
Spring AI Releases一手来源产品发布

Spring AI 2.0.0-RC1 发布:多项新特性与修复

Spring AI 发布了 2.0.0-RC1 版本,包含多项新特性、错误修复和文档更新。新特性包括为 MessageWindowChatMemory 添加回合边界裁剪、移除模型默认值、将 advisors 移至独立模块、移除内部工具执行等。错误修复涉及流式处理、span 层级和 JSON schema 生成等问题。该版本旨在简化 API 并提升可维护性。

6月5日周五 · 1 条
对比或关联对象命中实体:deepseek v4
vLLM Releases一手来源产品发布

vLLM v0.22.1 发布:新增 Mellum v2 支持与 Zen CPU 优化

vLLM 发布 v0.22.1 补丁版本,包含 8 个提交,来自 6 位贡献者。该版本新增对 JetBrains Mellum v2 模型的支持,并在 AMD Zen CPU 上通过 zentorch 加速量化线性推理,同时修复了多节点 Ray 数据并行服务、DeepSeek-V4 初始化等问题。

5月29日周五 · 1 条
对比或关联对象命中实体:deepseek v4
vLLM Releases一手来源产品发布

vLLM v0.22.0 发布:DeepSeek V4 成熟化与性能大幅提升

vLLM 发布 v0.22.0 版本,包含 459 个提交,来自 230 位贡献者。该版本重点提升了 DeepSeek V4 的成熟度,包括新增 NVFP4 融合 MoE 支持、CUDA 图优化和 MTP 投机解码。同时,Model Runner V2 成为 Qwen3 稠密模型的默认选项,并引入了实验性的 Rust 前端。性能方面,批量不变推理通过 Cut

5月27日周三 · 1 条
对比或关联对象命中实体:deepseek v4
SGLang Releases一手来源产品发布

SGLang v0.5.12.post1 发布:修复 DeepSeek V4 多项稳定性问题

SGLang 发布 v0.5.12.post1 稳定性补丁,包含 12 个修复,主要针对 DeepSeek V4 系列问题,如 B200/B300 上的解码乱码、EAGLE/MTP 崩溃、NSA 预填充调度器崩溃等,并修复了 PD 分离、HiSparse 精度等问题。性能方面优化了冷启动延迟和 JIT 编译成本。

5月17日周日 · 1 条
对比或关联对象命中实体:deepseek v4
SGLang Releases一手来源产品发布

SGLang v0.5.12 发布:全面支持 DeepSeek V4 并新增多项优化

SGLang v0.5.12 发布,重点支持 DeepSeek V4 的完整推理路径,包括多种并行策略、硬件适配、预填充-解码分离、HiSparse 和 HiCache 等特性,并新增多个模型支持如 Intern-S2-Preview、MiniCPM-V 4.6 等。此外,还集成了 TokenSpeed MLA 注意力后端,优化了 FP4 低延迟性能,并迁移

5月6日周三 · 1 条
对比或关联对象命中实体:deepseek v3
12月19日周五 · 1 条
对比或关联对象命中实体:deepseek r1
Baidu Qianfan Changelog一手来源产品发布

百度千帆平台更新:DeepSeek-R1缓存、多模态助手及MCP服务

百度千帆平台于2025年12月19日发布多项更新,包括DeepSeek-R1模型支持前缀缓存,AI助手新增多模态功能(自动搜图、搜视频、音频和Markdown文件解析),工作流支持异步调用和导入导出,并推出百度天气和代码安全MCP服务。这些更新旨在提升开发效率和多模态知识复用能力。

5月22日周四 · 1 条
对比或关联对象命中实体:deepseek r1
Text Generation Inference Releases一手来源产品发布

TGI v3.3.1 发布:升级 Torch 2.7 并支持 Llama4 与 DeepSeek R1

Hugging Face 发布了文本生成推理库 TGI 的 v3.3.1 版本,主要更新包括升级到 Torch 2.7 和 CUDA 12.8,并针对 HPU 后端优化了预热逻辑,支持 Llama4 和 DeepSeek R1 模型,同时修复了 GPU UUID 计数和默认注意力路径崩溃等问题。