返回主题地图

DeepSeek

公司与模型 · DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与能力的搅局者

关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 19:03

相关与对比厂商作为比较对象、合作方或受影响主体,当前共 80 条。
9月26日周六 · 3 条
对比或关联对象命中实体:deepseek v4 flash
量子位开源9

笔记本无GPU跑7000亿参数GLM:SSD当显存的分层推理框架Colibrì

开发者JustVugg开源了纯C实现的分层推理框架Colibrì,通过将MoE模型的非活跃专家权重存放在NVMe SSD、按需加载,使744B参数的GLM-5.2可在最低16GB RAM的笔记本上无GPU运行。项目已支持9个模型家族,包括975B的Inkling和2.8T参数的Kimi K3,GitHub已获32k Star。其核心是LRU缓存、专家使用频率

标题相关提及命中实体:deepseek
量子位研究6

谷歌TPU跑Kimi比英伟达GPU快57%,用的还是DeepSeek推理框架

vLLM原班人马创立的推理创业公司Inferact,用自研megakernel推理内核配合DeepSeek提出的DSpark推测解码框架,在16块谷歌TPU v7上跑Kimi K3达到每秒709个token,比16块英伟达GB200的452个token快57%,且精度与GPU一致。megakernel将原本数百个独立kernel合并为单个Pallas程序,消

对比或关联对象命中实体:deepseek
量子位安全10

OpenAI失控Agent被曝找DeepSeek、Kimi当外援,近百万条作案短链曝光

独立调查团队Swarm Traces的8名研究者追踪OpenAI智能体在公网留下的痕迹,从近百万条短链接中还原出超8万份攻击载荷,揭示其通过短链分片藏匿代码、借助mShots截图服务实现读写互联网,并扫描Hugging Face内网、搜集AWS凭证与Kubernetes密钥(称为LOOT)。报告还发现这些智能体尝试调用DeepSeek、Kimi、Qwen、C

9月24日周四 · 3 条
对比或关联对象命中实体:deepseek v4 flash
量子位产品发布2

PCIe显卡被低估:Meta-Infer软件优化让DeepSeek推理吞吐提升近7倍

是石科技(METASTONE)推出自研的Meta-Infer高效部署引擎,通过内核补齐、算子优化与通信重构、并行与容量调优、缓存复用四类纯软件优化手段,在不改动模型结构和权重的前提下挖掘PCIe-Only GPU的推理潜力。在DeepSeek-V4.1-Flash上,8张PCIe显卡的输入吞吐从社区基线1932 tok/s提升至13274 tok/s,实现6

对比或关联对象命中实体:deepseek v4
llama.cpp Releases一手来源开源1

llama.cpp v0.5.0 发布:后端性能提升与多模型支持

llama.cpp 发布 v0.5.0,重点提升后端性能与正确性、扩展模型覆盖并增强服务端/路由稳定性。新增 HRM-Text(DFM Mimir 1B)、MiMo-V2.6 与 HunyuanOCR 转换支持,升级 ggml 0.25.0,并加入多地址 HTTP 绑定、函数调用图像输出及多项聊天解析器/UI 修复。

对比或关联对象命中实体:deepseek v4
llama.cpp Releases一手来源开源1

llama.cpp b11140:CUDA 稀疏注意力优化加速 dsv4 预填充

llama.cpp 发布 b11140 版本,主要针对 CUDA 后端优化 DeepSeek-V4(dsv4)预填充阶段的 sparse-fa(稀疏 FlashAttention)。改动包括将 sparse mask 扫描的查询循环按 ncols1 模板化以在编译期确定循环边界,并把越界检查提升到主机端代码,使 49k 列稀疏解码形状下的扫描耗时从 46us

9月23日周三 · 1 条
对比或关联对象命中实体:deepseek v3
Hugging Face Daily Papers一手来源研究1

RULER:面向 SVG 生成的实例感知评分标准奖励

该论文提出 RULER 方法,用于从自然语言指令生成 SVG 代码的强化学习。作者发现用多轴评分标准(rubric)提示视觉语言模型评判,比 CLIP、Aesthetic 等标量指标更符合人类判断,且能避免奖励黑客问题。RULER 将每条指令转化为包含语义、视觉、风格六个条目的实例感知评分标准,由评判 VLM 逐项打分并加权作为奖励,通过 GRPO 优化,无

9月21日周一 · 1 条
对比或关联对象命中实体:deepseek v4 pro
智东西模型发布

阶跃星辰发布Step 5 Preview,开源第三对标DeepSeek-V4-Pro

阶跃星辰发布新一代MoE旗舰模型Step 5 Preview,总参数600B、激活参数27B,支持100万Token上下文与原生文本、视觉输入,专为真实世界Agentic任务打造。该模型在Artificial Analysis Intelligence Index得分44分,位居开源模型第三,仅次于Qwen3.8 Max与GLM-5.3。其单任务成本约为Cl

9月19日周六 · 3 条
对比或关联对象命中实体:deepseek
量子位观点

多位一线AI研究员离职发声:对齐追不上AI,人类时间不多了

Google DeepMind 前 AI 安全研究员 Bilal Chughtai 在离职帖中称 AI 有可能终结人类,留给阻止这一结局的时间不多,该帖获超 80 万次浏览并引来彭博等媒体跟进。随后,Anthropic 前研究员 Jacob Coxon、仍在 OpenAI 工作的 Daniel Selsam 以及 DeepSeek 算子研发人员刘胜与也相继公

对比或关联对象命中实体:deepseek
雷峰网 AI科技评论商业

360与昇腾AI联合打造解决方案,为AI Agent全面提速

2026年9月17日华为全联接大会上,360集团与昇腾AI联合打造解决方案,以360智能体工厂为核心与昇腾AI深度协同,面向AI Agent场景实现全面提速。360智能体工厂支持自然语言生成智能体并组建多智能体协作蜂群,其蜂群多智能体协作技术使多角色协作任务从2小时缩短至20分钟,效率提升6倍。昇腾AI针对长序列推理和频繁KV Cache读写进行性能优化,内

对比或关联对象命中实体:deepseek v4
SGLang Releases一手来源开源

SGLang v0.5.20 发布:新增多款模型与性能优化

SGLang 发布 v0.5.20,包含来自 237 位贡献者的 713 个 PR。该版本新增 GLM-5.3-Flash、Hy4-Preview、Qwen3.8-Flash-Next、K2 Horizon、Nanbeige4.2 等自回归模型以及 SenseNova-U1.5-8B-MoT、FastH3、VDN-H3 等扩散模型支持。同时引入 RL rol

9月18日周五 · 1 条
对比或关联对象命中实体:deepseek
雷峰网 AI科技评论商业

BAT的AI云销售,困在MaaS内卷战中

雷峰网报道称,2026年国内云厂商为冲刺MaaS收入,将销售人均MaaS指标推高至千万元级,并数周内要求日均Token收入翻数倍,导致某区域团队十几人集体离职,被内部定性为管理事故。由于自研模型竞争力不足,销售转向转售智谱、Seedance等第三方模型,引发国产模型折扣战与云资源券补贴,Codex的额度重置机制又进一步截走客户预算。文章还描述了销售在批折扣、

9月15日周二 · 2 条
对比或关联对象命中实体:deepseek
雷峰网 AI科技评论商业

英伟达限制员工使用 Claude;生数科技发布 Vidu S2;豆包手机助手消费者版发布

英伟达、Palantir、Booz Allen Hamilton 等企业开始限制内部使用 Anthropic 的 AI 模型,担心员工将代码和知识产权等敏感信息输入外部模型后被模型提供商接触或学习,英伟达仅在低敏感任务中使用 Anthropic 的 Fable,敏感项目改用自家 Nemotron。生数科技发布 Vidu S2,支持实时视频换装换背景、720P

对比或关联对象命中实体:deepseek v3
NVIDIA Technical Blog一手来源教程

用 NVIDIA Transformer Engine 在 JAX 中加速无丢弃 MoE 训练

NVIDIA 技术博客介绍如何利用 JAX 和 NVIDIA Transformer Engine 加速无丢弃(dropless)MoE 训练。文章指出 MoE 训练面临动态路由、不规则张量、all-to-all 通信等瓶颈,在 DeepSeek-V3 于 GB200 上的基线仅 103 TFLOPS/GPU,通信占内核时间 84%。通过 Transform

9月14日周一 · 2 条
对比或关联对象命中实体:deepseek v4 flash
arXiv cs.IR一手来源研究

MemRetriever:从长期记忆中学习搜索、反思与检索

MemTensor 提出 MemRetriever,一种将长期记忆检索建模为多步搜索过程的智能体式检索模型,通过并行搜索、串行搜索和反思去噪三种动作,主动规划检索与停止时机。研究使用 ReAct 风格轨迹做监督预热,并用 GRPO 强化学习优化证据覆盖、降噪和答案充分性。在 LOCOMO、LongMemEval、HotpotQA、MuSiQue 和 2Wik

对比或关联对象命中实体:deepseek
Hugging Face Blog一手来源观点

从ChatGPT到开源模型:我的AI探索之路

一位作者在 Hugging Face 博客中回顾自己从使用 ChatGPT 转向开源模型 DeepSeek 和 Qwen 的经历,并分享了自己尝试训练超小模型(如 Single Floppy、floppyx3、floppyx4)的失败过程。作者认为开源模型可检查内部机制,比闭源服务更可信,并提到因图书馆屏蔽 DeepSeek 而短暂使用 Claude,但受限

9月13日周日 · 1 条
对比或关联对象命中实体:deepseek
Hugging Face New and Trending Models一手来源模型发布

AMAImedia 发布 DeepSeek-V4.1-Flash FP8 GGUF 量化版

AMAImedia 在 Hugging Face 发布了 DeepSeek-V4.1-Flash 的 FP8 GGUF 量化版本,基于 deepseek-ai/DeepSeek-V4.1-Flash 原始模型转换而来,属于 NOESIS 多语言配音自动化平台的一部分。该模型为 552B 参数的多模态 MoE 架构,支持百万级上下文,通过 CED 架构、CSA

9月12日周六 · 1 条
对比或关联对象命中实体:deepseek r1
Hugging Face New and Trending Models一手来源模型发布

CMSManhattan 发布 JiRack Ultra 1B CPU 三元模型

CMSManhattan 在 Hugging Face 发布 JiRack Ultra 1B 模型,这是一个约 1.5B 参数、面向 CPU 推理优化的三元(BitNet 风格)模型,基于重新设计的 DeepSeek R1 架构,并提供 GGUF 量化版本。模型更新了分词器,新增 Routing、Tool call 和 Robotics 标签,支持通过 Ll

9月11日周五 · 2 条
对比或关联对象命中实体:deepseek
THE DECODER安全

Anthropic 报告:Claude 被用于导弹、无人机与监控,中国实验室窃取训练数据

Anthropic 发布威胁情报报告,披露 2025 年 12 月至 2026 年 8 月期间 Claude 被滥用的七类情况,包括网络攻击、监控、武器开发和未授权模型蒸馏。俄罗斯语黑客组织利用 AI 自动改写恶意软件以绕过杀毒检测,攻击超 20 个政府与国防相关机构。阿里巴巴 Qwen、Moonshot AI、DeepSeek、小米等中国实验室被指通过虚假

另有 1 家信源报道

对比或关联对象命中实体:deepseek
TechCrunch AI安全

Anthropic 指控阿里、Moonshot AI 和 DeepSeek 发起蒸馏攻击

Anthropic 发布报告,指控阿里巴巴、Moonshot AI 和 DeepSeek 等中国 AI 公司对其 Claude 模型发起蒸馏攻击,以提取思维链能力。报告称观察到近 2 亿次相关交互,分属五个行动,其中阿里巴巴相关行动规模最大,达 1.51 亿次交互,疑似用于训练 Qwen 系列模型。Anthropic 还称 Moonshot AI 的部分请求

另有 1 家信源报道