返回主题地图

DeepSeek

公司与模型 · DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与能力的搅局者

关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 19:03

顺带提及正文出现过,但不是文章的主要讨论对象,当前共 138 条。
9月15日周二 · 2 条
正文顺带提及命中实体:deepseek
arXiv cs.IR一手来源研究

混合专家语言模型可成为强大高效的检索器

该研究系统比较了混合专家(MoE)与稠密LLM作为一阶段检索器的效果与效率。在相同训练流程下,MoE检索器在BEIR上比激活参数量相当的稠密模型高1.4–3.0 nDCG@10,其中一个MoE检索器以少59%的激活参数和低18%的查询编码时间匹配8B稠密检索器。研究还表明,无需重训练或重建索引即可减少查询编码使用的专家数,保留99%以上效果并将查询编码时间最

正文顺带提及命中实体:deepseek
雷峰网 AI科技评论研究

阿尔伯塔大学提出FAME双系统框架破解持续强化学习遗忘困局

加拿大阿尔伯塔大学强化学习团队提出持续强化学习框架 FAME,通过快速学习模块与元学习模块的双系统设计,分别模拟海马体与大脑皮层协同机制,解决智能体学习新任务时遗忘旧知识的灾难性遗忘问题。论文定义了环境间距离与灾难性遗忘的数学度量,并在 MinAtar、Atari 和 Meta-World 上验证,在平均性能、前向迁移和遗忘三项指标上全面优于 Reset、微

9月14日周一 · 2 条
正文顺带提及命中实体:deepseek
NVIDIA Generative AI Blog一手来源产品发布

Perplexity 便携电脑登陆 Windows,由 NVIDIA RTX 驱动

Perplexity 将其本地智能体 Perplexity Computer 的便携版本 Portable Computer 扩展到 Windows 平台,支持配备 24GB 及以上显存的 NVIDIA GeForce RTX 和 RTX PRO 显卡。该版本由 NVIDIA GPU 加速,使用本地模型(如 Qwen 3.8 27B)在设备端分析数据、整合文

正文顺带提及命中实体:deepseek
智东西商业

智谱完成335亿元融资,押注RSI自训练体系

智谱宣布完成约50亿美元(约合人民币335.4亿元)融资,包括约20亿美元股份配售及约30亿美元零息可转债,资金约60%用于下一代GLM基础模型与完全自训练体系研发,重点探索递归式自我改进(RSI)循环。公司披露2026年上半年营收9.54亿元、同比增长近400%,MaaS及API收入8.25亿元,ARR达16亿美元。此举反映国产大模型头部厂商融资与上市竞赛

9月12日周六 · 1 条
正文顺带提及命中实体:deepseek
Vercel AI SDK Releases一手来源API 更新

Vercel AI SDK 发布 @ai-sdk/xai 4.0.58 补丁

Vercel AI SDK 发布 @ai-sdk/xai@4.0.58 补丁版本,修复了不支持批量请求类型被错误接受的问题,并新增批量图像生成请求支持。同时修复了 DeepSeek 在空工具调用增量下推理流丢失的问题,并更新了 @ai-sdk/provider 与 @ai-sdk/provider-utils 依赖。

9月11日周五 · 4 条
正文顺带提及命中实体:deepseek r1
Interconnects AI观点

开源 AI 与开放模型阅读清单

Interconnects AI 作者 Nathan Lambert 发布并持续更新一份关于开源 AI 与开放模型的阅读清单,汇总近几年的代表性文章。清单按基础概念、中美竞争、技术细节等主题组织,涵盖开放模型的定义、发布动机、商业战略、安全风险、数据缩减以及中国模型(如 Kimi K3、GLM-5.2)对生态的影响。文中还提到西方公司采用中国模型引发监管关注

正文顺带提及命中实体:deepseek v4 flash 0731
llama.cpp Releases一手来源开源

llama.cpp b10909:Metal 后端融合表重构与性能修复

llama.cpp 发布 b10909 版本,主要重构 Metal 后端的算子融合机制,将所有可融合模式统一到单张融合表(ggml-metal-fuse.cpp),供图优化器和算子编码器共用。修复了融合模式中输出索引使用相对索引导致 norm/MUL 融合被静默禁用、token 生成性能回退约 5% 的问题。新增 gated delta net 与 KV c

正文顺带提及命中实体:deepseek v4
InfoQ AI ML and Data Engineering研究

LinkedIn 用多教师蒸馏将 AI 职位搜索训练提速 8 倍

LinkedIn 公布了其 AI 职位搜索背后的训练基础设施,采用多教师蒸馏流水线,将 8B 相关性教师模型和 1.7B 互动教师模型的知识压缩进 0.6B 参数的排序模型。系统基于开源 SGLang 构建自定义框架,在训练循环中直接服务教师模型,并通过在线/离线蒸馏拆分、LiGer、多节点训练、FSDP2 和 H200 集群等优化实现约 8 倍训练加速。该

正文顺带提及命中实体:deepseek r1
AWS Machine Learning Blog一手来源产品发布

AWS SageMaker HyperPod 推出模型缓存,大幅减少推理冷启动

AWS 为 Amazon SageMaker HyperPod 上的推理推出模型缓存功能,通过预加载模型权重和容器镜像到集群节点的本地 NVMe 存储,将推理 Pod 的冷启动时间从数十分钟缩短到数秒。该功能针对 DeepSeek-R1 等 600GB 以上大模型,解决自动扩缩容时因重复下载镜像和权重导致的响应延迟问题。缓存采用优先调度而非强制调度,未命中缓

9月10日周四 · 1 条
正文顺带提及命中实体:deepseek v4 flash
智东西产品发布

实测匿名模型Omen Alpha:速度快性价比高,但逻辑推理不足

智东西报道了一款名为Omen Alpha的匿名模型,该模型在OpenCode调用量榜单中排名第七,以超高性价比和快速开发能力著称。实测显示,Omen Alpha具备视觉能力,能快速完成前端开发、游戏开发和3D建模,但在逻辑推理方面表现不佳,如洗车难题和公务员考试题正确率仅80%。目前该模型仅在OpenCode Go订阅套餐中可用,价格极低。

9月9日周三 · 2 条
正文顺带提及命中实体:deepseek r1
雷峰网 AI科技评论研究

极佳视界联合顶尖高校发表7篇ECCV论文,破解空间智能落地瓶颈

极佳视界联合清华大学、中科院自动化所等机构,在ECCV 2025上发表了13篇论文,其中7篇聚焦空间智能与物理AI,提出VLA-R1、OmniNWM、ReconPhys等模型,分别解决具身决策推理、驾驶世界模型闭环评估、3D资产物理属性重建等瓶颈,旨在推动物理AI从实验室走向工业落地。

正文顺带提及命中实体:deepseek
智东西商业

Mistral完成30亿欧元D轮融资,估值超210亿欧元

法国AI公司Mistral完成30亿欧元D轮融资,投后估值超210亿欧元,由三星电子领投,ASML、英伟达等参投,创欧洲科技公司单轮融资纪录。资金将用于模型研发、算力扩展和商业增长,目前业务覆盖20国,服务超125家企业。Mistral近期发布Mistral Medium 3.5和Agentic Search等产品,但曾陷入使用DeepSeek模型蒸馏的争议

另有 1 家信源报道

9月8日周二 · 3 条
正文顺带提及命中实体:deepseek
量子位模型发布

王云鹤创业后首发Agent-Native模型NeoHorse

华为诺亚方舟实验室前主任、盘古大模型负责人王云鹤创办的基元律动公司发布了首个Agent-Native模型NeoHorse,包含4B和9B两个版本。该模型利用其Routing Harness系统积累的多模型执行轨迹数据进行后训练,在Agent相关评测中4B模型表现达到或略超9B基础模型。公司旨在通过将执行经验转化为模型能力,构建从模型路由到训练改进的闭环,并探

正文顺带提及命中实体:deepseek
Latent Space研究

Latent Space 发布前沿 AEO 追踪器:分析模型推荐偏好与偏差

Latent Space 发布了一个前沿 AEO(AI 引擎优化)追踪器,基于 7 个前沿模型在 161 个类别中的推荐结果,分析各产品在 AI 推荐中的主导地位。报告发现模型存在偏好偏差(如 Claude 推荐自家产品),但也观察到跨模型推荐案例。此外,Anthropic 的新模型 Astra 比 Sol 更自信且搜索来源更少,影响了 AEO 策略的有效性

正文顺带提及命中实体:deepseek
THE DECODER商业

ChatGPT网站流量份额回升至55.5%,Gemini短暂反弹消退

Similarweb数据显示,ChatGPT在AI聊天机器人网站流量中的份额从三个月前的52.7%回升至55.5%,而谷歌Gemini的份额则从27.8%下滑至25.6%。同比来看,ChatGPT的份额从73.3%大幅下降,Gemini份额翻倍,Anthropic的Claude从1.9%增长至9.3%。这些数据仅涵盖网站流量,未计入移动应用和桌面端使用。

9月7日周一 · 3 条
正文顺带提及命中实体:deepseek
量子位商业

GOSIM Shenzhen 2026 全议程公布:DHH领衔,聚焦开源AI技术栈

GOSIM Shenzhen 2026 开源技术大会将于 10 月 16-17 日在深圳举办,由 DHH 领衔,汇聚英伟达、微软、HuggingFace 等 150+ 全球讲师。大会设置 6 大技术主题论坛、7 场 Workshop、4 场 Hackathon 及 Spotlight 项目路演,聚焦 Agent、开源模型、机器人、边缘智能等下一代开源 AI

正文顺带提及命中实体:deepseek v4 flash
量子位研究

国内首份办公Agent用户行为报告发布:北京居首,海外用户超12%

国内首份《中国办公Agent用户行为不完全报告》于9月7日在北京发布,基于LobsterAI的真实用户数据。报告显示北京用户量全国居首,海外用户占比超12%,前20%用户消耗87.4%算力,单次任务规模5个月增长3.1倍,非办公时间token消耗近60%,DeepSeek V4 Flash最受欢迎。该报告揭示了办公Agent正从对话走向深度工作,成为通用AI

正文顺带提及命中实体:deepseek
雷峰网 AI科技评论商业

AI人才三波大迁徙:从百度到六小虎再到腾讯

国内AI人才经历三波大迁徙:从百度等大厂流向AI六小虎和字节等,再到百川智能、零一万物等战略收缩后人才流向腾讯等。深层原因包括股价、战略导向和组织架构。当前趋势是人才流动加速,AI Infra和数据人才受追捧,预训练需求下滑。

9月6日周日 · 1 条
正文顺带提及命中实体:deepseek
THE DECODER产品发布

Abliteration.ai 提供去除安全护栏的开源模型商业 API

美国初创公司 Abliteration.ai 推出商业服务,通过“abliteration”技术移除开源权重模型(如智谱 GLM-5.3)的安全拒绝机制,并以 API 形式出售访问权限,用于网络安全测试和红队演练。该服务降低了使用门槛,但也引发了对滥用的担忧。公司声称不存储提示和响应日志,且不要求身份验证,进一步增加了监管难度。

9月5日周六 · 1 条
正文顺带提及命中实体:deepseek v3
SGLang Releases一手来源产品发布

SGLang v0.5.19 发布:新增模型支持与多项性能优化

SGLang 发布 v0.5.19 版本,包含 786 个 PR,来自 214 位贡献者。新增支持 Qwen3.8、Ling-3.0、Granite 4.2 等多个模型,并引入 beam search、DeepEP v2、LayerNorm 序列并行等多项性能优化。这些改进提升了推理吞吐量、降低了延迟,并扩展了硬件兼容性。