返回主题地图

DeepSeek

公司与模型 · DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与能力的搅局者

关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 19:03

核心动态标题或摘要核心在讲该厂商及其模型,当前共 55 条。
9月25日周五 · 2 条
摘要核心命中命中实体:deepseek
雷峰网 AI科技评论研究3

梁文锋署名11篇论文:从MoE到DSec的底层技术狙击史

雷峰网AI科技评论梳理了梁文锋过去三年署名的11篇论文,涵盖DeepSeek LLM、DeepSeekMoE、DeepSeek-V2、DeepSeek-Coder-V2、DeepSeek-V3、DeepSeek-R1、NSA、mHC、DSpark及最新DSec等。文章称这些论文分别从数据配比、MoE架构、MLA注意力、代码能力、低成本训练、纯强化学习推理、硬

标题直接命中命中实体:deepseek
智东西商业2

DeepSeek被曝冲刺5000亿元估值,年化营收达67亿元

据The Information报道,DeepSeek年化营收运行率已达10亿美元(约67.13亿元人民币),较数月前不足5亿美元翻倍以上,由创始人梁文锋在投资者会议披露。DeepSeek正敲定新一轮500亿元人民币融资,目标估值5000亿元人民币,并同步筹备科创板IPO。其收入几乎全部来自API调用,涨价后客户未流失,但公司仍将超70%算力投入新模型训练,

9月24日周四 · 1 条
标题直接命中命中实体:deepseek
智东西研究1

梁文锋署名,DeepSeek公开Agent训练沙盒平台DSec技术细节

DeepSeek创始人梁文锋署名的最新论文公开了Agent训练沙盒平台DSec(DeepSeek Elastic Compute)的技术细节,该平台自DeepSeek V4技术报告首次出现,支撑了从V3.2到V4.1的RL训练与评测。DSec单日服务约300万个沙盒,峰值并发超38万个,通过四种后端、分层镜像按需加载和rollout与GPU训练分离等设计解决

另有 1 家信源报道

9月23日周三 · 3 条
标题直接命中命中实体:deepseek
量子位研究1

DeepSeek公开Agent训练系统DSec,梁文锋署名

DeepSeek发布由梁文锋署名的论文,公开其Agent训练基础设施DSec(DeepSeek Elastic Compute)。该系统每秒可创建5000+个沙盒、日产能达300万个、峰值并发38万个,单集群约160节点、3万核CPU、250TB内存。DSec通过FnCall、Container、MicroVM、Full VM四种后端统一调度,并用EROFS

另有 1 家信源报道

标题直接命中命中实体:deepseek
雷峰网 AI科技评论商业

苹果高管不建议给iPhone贴膜引热议;DeepSeek将向联合国安理会介绍AI风险;Meta个人AI助手Muse爆红

苹果硬件工程副总裁Tom Marieb公开表示不建议用户给iPhone贴屏幕保护膜,称团队在屏幕耐刮耐磨方面投入大量研发,希望用户直接体验原厂屏幕,此番言论引发网友热议。此外,DeepSeek将向联合国安理会介绍AI风险,月之暗面等中国企业也受邀参会;Meta个人AI助手Muse上线两周下载量超250万次,登顶美国iOS免费榜,带动Meta股价单日上涨11.

标题直接命中命中实体:deepseek v4 flash 0731
Hugging Face New and Trending Models一手来源开源1

DeepSeek-V4-Flash 面向 Strix Halo 的 ROCmFPX 量化 GGUF 发布

Geometric-AI 与 Lucebox 在 Hugging Face 发布了面向 128GB AMD Strix Halo 系统的 DeepSeek-V4-Flash-0731 量化 GGUF 文件,单个 98.29GB 文件在 92 题评测中取得 82/92 分,平均每权重约 2.766 比特。同时还发布了支持图像输入的 DeepSeek-V4-Fl

9月22日周二 · 1 条
标题直接命中命中实体:deepseek
9月15日周二 · 1 条
摘要核心命中命中实体:deepseek
量子位商业

梁文锋CFO到位!投过智谱MiniMax

路透援引知情人士消息称,DeepSeek计划聘请高瓴创投合伙人严文韬担任公司首任CFO。严文韬1991年生,曾投资字节跳动、小红书、极兔、MiniMax、智谱等项目。此前DeepSeek于2025年2月挂出CFO岗位但长期空缺,今年7月重启招聘并密集面试头部VC年轻合伙人。报道还提及DeepSeek已聘请中信证券筹备科创板IPO,最早今年年底递交申报材料,力

9月12日周六 · 1 条
标题直接命中命中实体:deepseek
Latent Space模型发布

DeepSeek 发布 V4.1-Flash:763B-P8B-D16B 因果编码器-解码器架构

DeepSeek 发布开源旗舰模型 V4.1-Flash,采用全新的因果编码器-解码器架构,总参数 763B,输入/prefill 激活 8B、输出/decode 激活 16B,支持 1M 上下文与文本+图像输入,MIT 许可。Artificial Analysis 测得其在智能指数上以 40 分超过 V4 Pro 0813,定价为每百万输入 token 0

9月10日周四 · 3 条
标题直接命中命中实体:deepseek
THE DECODER模型发布

Deepseek 发布 V4.1-Flash,大幅降低 AI 智能体内存需求

Deepseek 发布新模型 V4.1-Flash,通过大幅压缩 KV 缓存降低长文本处理成本:快速 GPU 内存中的缓存仅需前代 V4-Flash 约四分之一,永久卸载部分降至约八分之一,相比 V1 每 token 全局 KV 缓存缩小 437 倍。模型采用输入/输出计算拆分,读取输入时每 token 仅激活 80 亿参数、生成时激活 160 亿,并将主

另有 1 家信源报道

标题直接命中命中实体:deepseek
雷峰网 AI科技评论模型发布

深度解读 DeepSeek V4.1 Flash 全新架构,如何成为显存杀手

DeepSeek 上线 V4.1-Flash,采用因果编码器-解码器(CED)、第二代压缩稀疏注意力(CSA2)与三档推理力度旋钮的全新架构,针对长上下文场景重写。该架构将运行时显存占用降低约 3/4,落盘持久 KV 缓存降至上一代的 1/8,KV 缓存最高暴降 437 倍,使百万 Token 级长上下文进入工业级生产力阶段。模型主干 552B 参数、外挂

标题直接命中命中实体:deepseek
DeepSeek API Changelog一手来源模型发布

DeepSeek-V4.1-Flash 发布并上线 API,价格下调

DeepSeek 正式发布 DeepSeek-V4.1-Flash 模型,这是其全新模型结构系列中最小尺寸的模型,具备原生多模态视觉理解能力,并公布了 GPQA Diamond、HLE、Codeforces 等多项基准成绩。该模型已同步上线 DeepSeek API,调用模型名改为 deepseek-flash,旧版 V4 Flash 与 V4 Flash

另有 1 家信源报道

9月9日周三 · 1 条
摘要核心命中命中实体:deepseek
智东西商业

2026上半年全球AI融资超2.7万亿,中国77起上亿元融资领跑数量

2026年上半年,全球AI产业链上亿元融资事件共165起,总额约2.7万亿元。中国以77起融资事件数量居首,总额约1262亿元;美国以71起融资事件和约2.46万亿元金额领先,主要由OpenAI、Anthropic等头部企业拉动。国内融资集中于北京、上海、杭州、深圳,其中DeepSeek以500亿元单笔融资拉动杭州金额居首。融资向AI应用、视频生成、AI A

9月4日周五 · 1 条
标题直接命中命中实体:deepseek
THE DECODER商业

Deepseek计划在内蒙古部署16万颗华为芯片,打造最大集群

Deepseek计划在内蒙古建设一个大型数据中心,部署至少16万颗华为下一代Ascend-950DT芯片,这将是已知最大的华为芯片集群,但仅用于推理,训练仍依赖英伟达硬件。由于生产限制和内存短缺,华为可能无法在一年内交付全部订单,而中国内存制造商CXMT首次小批量生产HBM3E,但技术仍落后三星等厂商三至五年。此举是中国政府推动芯片产业自主化的一部分。

9月3日周四 · 1 条
摘要核心命中命中实体:deepseek v4 flash 0731
Hugging Face New and Trending Models一手来源模型发布

DeepSeek-V4-Flash 定制 GGUF 发布,面向 AMD Strix Halo 优化

Hugging Face 上发布了 DeepSeek-V4-Flash-0731 的定制 GGUF 量化版本,专为 AMD Strix Halo 平台的 Ember 运行时设计,采用 ROCmFPx 自定义张量类型,不兼容主流 llama.cpp 等运行时。该版本经过 abliteration 和重要性矩阵校准,并附带 DSpark 草稿模型,在 AMD R

9月1日周二 · 4 条
标题直接命中命中实体:deepseek
雷峰网 AI科技评论开源

DeepSeek V4 多模态开源:视觉链路深度拆解

DeepSeek 开放了 V4 多模态模型的权重和推理代码,揭示了其视觉处理链路:通过 32 层 ViT 编码图像,使用 Aligner 将视觉特征压缩并映射到语言空间,视觉 Token 直接融入 V4 主干参与 Attention 和 MoE 路由。该设计针对 Agent 场景优化,支持长上下文和工具调用,但面临重复计算和视觉状态管理的挑战。

标题直接命中命中实体:deepseek
雷峰网 AI科技评论研究

DeepSeek Harness插件生态乱象:1.1万插件仅千个可用,安全机制缺失

雷峰网对DeepSeek Harness插件生态进行了全面调查,发现其1.1万个插件中仅不到1000个可用,官方缺乏治理机制,包括无插件目录、无安全校验等。调查还发现插件权限形同虚设,存在安全风险,且生态中充斥着大量无关或低质量插件。文章指出DeepSeek将工程制品当作产品发布,导致用户需自行承担安全责任,生态可能被老玩家占据。

标题直接命中命中实体:deepseek
雷峰网 AI科技评论研究

DeepSeek V4 Pro与Harness深度拆解:后训练成主战场,缓存优化控成本

雷峰网发布万字长文,拆解DeepSeek V4 Pro与Harness框架。文章通过实测发现,V4 Pro在Terminal Bench等agentic任务上大幅提升,但相比Flash性价比不高,且其1M上下文是通过YaRN外推实现,但实测未衰减。DeepSeek通过缓存优化和定价策略控制成本,并开源Harness框架,强调后训练成为旗舰模型升级主战场。

标题直接命中命中实体:deepseek
智东西模型发布

DeepSeek-V4多模态模型开源,多项基准超越Opus-4.8

DeepSeek于8月31日开源了其V4系列首个实验性多模态模型DeepSeek-V4-Flash-Vision-Exp,该模型基于V4-Flash架构并集成视觉模块,解锁了视觉理解能力。在多项基准测试中,该模型在纯文本智能体任务和多模态智能体能力上表现优异,部分指标超越Opus-4.8,但在复杂数据科学任务上仍有差距。此前该模型已于8月21日上线DeepS

另有 1 家信源报道

8月31日周一 · 1 条
标题直接命中命中实体:deepseek
DeepSeek API Changelog一手来源模型发布

DeepSeek 合并升级 V2.5 模型,代码与通用能力显著提升

DeepSeek 将 DeepSeek V2 Chat 和 DeepSeek Coder V2 合并升级为 DeepSeek V2.5,API 用户可通过 deepseek-coder 或 deepseek-chat 访问新模型。新模型在通用能力和代码能力上显著提升,多项基准测试成绩均有提高,包括 ArenaHard、AlpacaEval 2.0、MT-Be