返回主题地图

DeepSeek

公司与模型 · DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与能力的搅局者

关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 19:03

顺带提及正文出现过,但不是文章的主要讨论对象,当前共 138 条。
9月26日周六 · 2 条
正文顺带提及命中实体:deepseek v4 flash
THE DECODER研究7

英伟达 SoL-Pi 通过优化 harness 将编码智能体 token 用量减半

英伟达研究人员提出 SoL-Pi 系统,通过自动优化编码智能体的控制层(harness)来降低 token 消耗。该系统让一个研究智能体观察另一个智能体的执行轨迹、提出修改并在预设环境中测试,在 535 个可执行环境中探索了 152 个方向,生成超 3000 次运行。在 EdgeBench 的 51 个公开任务上,SoL-Pi 性能与原始 Pi harnes

正文顺带提及命中实体:deepseek
Mem0 Releases一手来源开源8

Mem0 Node SDK v3.3.1 修复配置与向量存储问题

Mem0 发布 Node SDK v3.3.1,主要修复配置、向量存储与打包问题。ConfigManager 不再向非 OpenAI 的 LLM 提供商注入 OpenAI 默认 baseURL 和 model,使 DeepSeek、xAI 等回退到自身默认值与环境变量。Turbopuffer 过滤器现支持全部操作符,欧氏距离搜索改用 1/(1+distanc

9月25日周五 · 2 条
正文顺带提及命中实体:deepseek
量子位产品发布2

平头哥发布真武V900芯片并扩大T-Head SAIL开源

在2026年9月云栖大会上,阿里巴巴旗下平头哥发布新一代AI芯片真武V900,并宣布AI软件栈T-Head SAIL进一步开源,开放PyTorch适配、迁移工具、算子开发工具及计算加速库等项目。真武芯片已服务20多个行业650多家客户,蚂蚁、小红书、小鹏汽车等基于SAIL进行模型迁移与优化。此举旨在降低客户迁移成本、让开发者参与芯片性能优化,并推动大厂造芯从

另有 1 家信源报道

正文顺带提及命中实体:deepseek r1
arXiv cs.IR一手来源研究4

Seek:面向知识检索的自评估探索框架

该论文提出 Seek,一个无需训练的迭代式知识检索框架,通过在测试时多轮交互语料库来克服单次检索的局限。每轮由 LLM 生成伪段落扩展查询、检索器获取新候选、专用评估器给出分级相关性判断并指导后续轮次。在 TREC Deep Learning 上 Seek 匹配训练过的重排序器并提升 Recall@100;在 BRIGHT 上 Qwen2.5-7B 相对 B

9月23日周三 · 4 条
正文顺带提及命中实体:deepseek
Agno Releases一手来源开源1

Agno v3.0.11 发布:新增知识检索流水线与重排序器

Agno 发布 v3.0.11 版本,新增知识检索流水线、MMR 重排序器、Recency 重排序器、页面源迁移工具、Y-API 作为 OpenAI 兼容模型提供商,以及运行输出中的取消阶段字段。同时改进 MCP 工具模式与推理检测,修复工具钩子、MCP 服务器路由、AG-UI 协议支持、WebSocket 工作流等多项问题,并弃用向量数据库级别的 rera

正文顺带提及命中实体:deepseek
量子位产品发布1

阿里千问AI平台全面升级模型服务、Agent服务与AI应用

9月22日云栖大会MaaS & Agent技术主论坛上,阿里巴巴集团战略副总裁文征宣布千问AI平台全面升级,在模型服务基础上新增Agent服务与行业AI解决方案,并推出API优速模式、Agent Studio、千问AI座舱解决方案等能力。平台通过FlashBoot、UniScheduler等将模型弹性启动时间从1200秒缩短至70秒,首Token延迟降低38

正文顺带提及命中实体:deepseek
智东西产品发布

浪潮信息发布SD200 Ultra与HC2000,破局Agent算力

在AICC 2026大会上,浪潮信息发布元脑SD200 Ultra超节点AI服务器和元脑HC2000多元算力机组,分别面向Agent时代算力的“向上”与“向广”需求。SD200 Ultra以128芯本土AI芯片、3D HyperMesh架构和8TB带宽、64TB内存,实现单机运行2.8万亿参数Kimi K3,Token生成时延首次突破5.85毫秒,并支持10

另有 1 家信源报道

正文顺带提及命中实体:deepseek r1
智东西模型发布

小米开源MiMo-V2.6系列全模态模型,押注大规模RL扩展

小米大模型团队发布并开源新一代原生全模态模型Xiaomi MiMo-V2.6系列,包含MiMo-V2.6-Pro与MiMo-V2.6-Flash,并预告将开放速度提升20倍的MiMo-V2.6-Pro-UltraSpeed。该系列押注大规模强化学习扩展,进行了开源模型迄今最大规模的单次RL训练,并同步开源RL训练环境、框架及技术报告。MiMo-V2.6-Pr

9月22日周二 · 6 条
正文顺带提及命中实体:deepseek r1
量子位模型发布

小米直播6天烧2000多万训练MiMo-V2.6,拿下开源第一并全量开源

小米将MiMo-V2.6-Pro和Flash的大模型强化学习训练全程直播,6天花费约350万美元(约2344万元人民币),Pro以1.02万亿参数、420亿激活在Artificial Analysis Intelligence Index上获46分,位列开源第一。小米同时开源模型权重、技术报告、7000多个RL任务环境和端到端RL训练框架,并披露了异步RL架

正文顺带提及命中实体:deepseek
THE DECODER模型发布

小米MiMo-V2.6-Pro登顶开源模型榜,Anthropic指控其蒸馏Claude

小米发布MiMo-V2.6系列开源模型,旗舰版MiMo-V2.6-Pro在Artificial Analysis智能指数上得分46,成为当前最强开源模型,且每百万输入/输出token价格仅为0.435/0.87美元,单任务成本约0.13美元。性能提升主要来自大规模扩展的强化学习,训练不到六天,Pro成本约262万美元。小米同时开源了RL工具包、训练框架及约7

正文顺带提及命中实体:deepseek
Latent Space模型发布

小米 MiMo-V2.6-Pro 开源:1T-A42B 新晋最强开源权重模型,训练成本 300 万美元

小米发布 MiMo-V2.6 系列开源全模态模型,其中 MiMo-V2.6-Pro 以 1.02T 总参数、42B 激活参数登顶开源权重模型智能指数(46),训练成本约 300 万美元。小米同时开源 RL 环境、训练配方与代码,并披露 RL 训练细节(130 小时、75B tokens、约 260 万美元)。此举被视为中国前沿实验室开源发布潮的一部分,也凸显

正文顺带提及命中实体:deepseek r1
量子位模型发布

阿里云栖大会:Qwen4.5后模型将扩展至5-10T参数

在9月22日云栖大会上,阿里巴巴公布千问大模型系列进展:基于新一代架构的Qwen4已在训练中,未来Qwen4.5、Qwen5计划扩展至5-10T参数;Qwen3.8-Max通过递归自我改进(RSI)在人类零参与下自主迭代超1个月、完成33轮迭代,Artificial Analysis得分从40升至45。阿里同时发布Qwen3.8-Flash、Qwen3.8-

正文顺带提及命中实体:deepseek
量子位模型发布

阿里公布全模态模型新进展,Qwen4和下代视频模型均在训练中

在2026云栖大会上,阿里巴巴公布大模型最新进展:Qwen3.8-Max在编程与办公领域表现强劲并登顶多个榜单,基于下一代架构的Qwen4已投入训练,未来Qwen4.5、Qwen5参数将扩展至5到10万亿。阿里还发布Qwen-Image-3.1、Qwen-Audio-3.1、Wan3.0、HappyOyster 2.0 Preview等多模态模型,并披露大模

正文顺带提及命中实体:deepseek r1
量子位产品发布

浪潮信息发布元脑SD200 Ultra与HC2000,破解智算能力与产能双重瓶颈

在AICC 2026上,IDC发布《2026年中国人工智能计算力发展评估报告》,指出Agent时代算力需求正从脉冲式调用转向持续负载,全球Token消耗量到2030年复合增长率达4822.6%,算力缺口绝对值将达3809亿美元。浪潮信息首席AI战略官刘军将算力问题拆分为Capability(能力型智算)与Capacity(容量型智算)两个方向,并发布超节点A

另有 1 家信源报道

9月21日周一 · 1 条
正文顺带提及命中实体:deepseek
Interconnects AI观点

开放模型当前的力量格局:中美竞争现状

Interconnects AI 作者向美国国会议员及幕僚介绍开放权重模型在中美竞争中的现状。文章指出,自 2025 年 4 月起中国 AI 公司在开放权重模型领域明显领先,Hugging Face 下载量约为美国的两倍(32 亿对 16 亿),在 Artificial Analysis 智能指数上中国模型 GLM-5.3、Kimi K3 等得分 42-45

9月20日周日 · 1 条
正文顺带提及命中实体:deepseek
量子位模型发布

中国电信开源全栈国产模型Xing4.0-29B-A4B,单张3090可跑

中国电信AI开源了全栈国产化的轻量级代码智能体大模型Xing4.0-29B-A4B,采用MoE架构,总参数290亿、每次推理仅激活约40亿,经4-bit量化后可在单张RTX 3090上运行。该模型完全基于华为昇腾910C算力与MindSpore/MindFormers框架训练,支持256K上下文并可扩展至512K,重点强化Coding与Agent能力,已适配

9月19日周六 · 1 条
正文顺带提及命中实体:deepseek
AWS Machine Learning Blog一手来源模型发布

Kimi K3 上线 Amazon Bedrock

Moonshot AI 的 Kimi K3 模型在 Amazon Bedrock 上线,据 Moonshot AI 称这是其最强模型,也是首个达到 2.8 万亿参数的开源模型,具备原生视觉能力和 100 万 token 上下文窗口,相比 Kimi K2 扩展效率提升约 2.5 倍。Kimi K3 是 Bedrock 上首个支持显式提示缓存的开源权重模型,可降

9月16日周三 · 2 条
正文顺带提及命中实体:deepseek
量子位产品发布

B站AI无限竞技场上线,全球百大模型同场竞技

B站于9月16日正式上线「AI无限竞技场」,这是一个汇集UP主大模型测评的竞技广场,首期榜单同步公布。GPT-6 Astra在10个UP主测评中拿下榜首,前五名中国产大模型占据三席。该平台由各领域UP主对上百个大模型进行真实场景实测,涵盖代码、推理、协作、知识等主题,排名实时更新并持续开放报名。

正文顺带提及命中实体:deepseek
量子位产品发布

被英伟达点名的杭州团队发布Lévin™ Harness,补上AI for Science最后一公里

杭州AI蛋白质设计公司力文所发布Lévin™ Harness,一款面向科研社区的Agent工作台,将数据、模型、插件工具、算力和工作流整合到同一环境,支持蛋白质结构预测、序列设计等任务,并允许用户通过插件接入自有模型与算力。该产品旨在解决AI for Science中模型之外的流程衔接问题,让Agent组织科研闭环。力文所此前自研全原子蛋白质生成模型Pall

9月15日周二 · 1 条
正文顺带提及命中实体:deepseek
THE DECODER观点

大AI提议放缓开发引争议:安全还是卡特尔?

Anthropic CEO Dario Amodei 呼吁行业与政府协调放缓前沿 AI 开发,并要求反垄断豁免以实施该计划,Sam Altman、Elon Musk 等人表示支持。Cohere CEO Aidan Gomez 批评该提议是设置进入壁垒、锁定市场的「卡特尔」,Hugging Face 工程师 Niels Rogge 称其为「最离奇的胡言乱语」。