DeepSeek 升级 deepseek-chat 模型,指令跟随与 JSON 输出显著提升
DeepSeek 将 deepseek-chat 模型升级为 DeepSeek-V2-0517,显著提升了指令跟随性能,IFEval Benchmark 准确率从 63.9% 提升至 77.6%。同时优化了 API 的 system 指令跟随能力,增强了沉浸式翻译和 RAG 等任务的用户体验。模型在 JSON 格式输出准确性上也有提升,内部测试中 JSON
公司与模型 · DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与能力的搅局者
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 19:03
DeepSeek 将 deepseek-chat 模型升级为 DeepSeek-V2-0517,显著提升了指令跟随性能,IFEval Benchmark 准确率从 63.9% 提升至 77.6%。同时优化了 API 的 system 指令跟随能力,增强了沉浸式翻译和 RAG 等任务的用户体验。模型在 JSON 格式输出准确性上也有提升,内部测试中 JSON
DeepSeek 将 deepseek-chat 和 deepseek-reasoner 升级为 DeepSeek-V3.1,分别对应非思考模式和思考模式。新模型采用混合推理架构,支持两种模式,思考效率较 R1-0528 提升,并通过后训练优化增强了 Agent 能力,在 SWE-bench 等基准上表现优异。
DeepSeek 将 deepseek-chat 和 deepseek-reasoner 升级为 DeepSeek-V3.1-Terminus,分别对应非思考模式和思考模式。此次更新改进了语言一致性,缓解中英文混杂和异常字符,并优化了 Code Agent 与 Search Agent 的表现。
DeepSeek 非正式部署了 DeepSeek-V3.2-Speciale 的 API 服务,用户可通过特定 base url 访问。该模型 API 价格不变,仅支持思考模式对话,不支持工具调用,最大输出长度 128K,服务截止至 2025 年 12 月 15 日。
DeepSeek API 发布 V4-Pro 与 V4-Flash 模型,支持 OpenAI 和 Anthropic 接口,base url 不变,但需更新 model 参数。旧模型名 deepseek-chat 和 deepseek-reasoner 将在三个月后停用,期间分别映射到 V4-Flash 的非思考与思考模式。
DeepSeek 发布 V4-Pro 正式版,同步上线 APP、网页端和 API,模型名 deepseek-v4-pro。该版本显著增强 Agent 能力,在多项基准测试中表现优异,并原生支持 OpenAI Responses API 格式,适配 Codex。同时新增思考强度控制(low/high/max),并调整 API 定价,采用峰谷定价策略,闲时价格减
DeepSeek 发布了实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,已上线 API 平台,用户可通过设置 model='deepseek-v4-flash-vision-exp' 访问。该模型在纯文本能力上与正式版持平,但在视觉理解的 Agent 基准测试中大幅提升,接近 Opus-4.8。
另有 1 家信源报道
阿里巴巴宣布拟配售800亿港元新股,所得款项净额将100%用于投资全栈AI能力,加强AI基础设施建设。这是阿里2019年港股上市以来首次启动新股配售。此外,DeepSeek优化峰谷计费规则,周末全天按低谷价计费;英伟达搭载AI芯片的服务器价格将上涨超15%。
中国AI公司Deepseek发布了实验性多模态模型V4-Flash-Vision-Exp,在图像理解基础上保持文本性能,其内部基准测试显示在智能体任务上接近Opus 4.8。该模型支持多种图像输入方式,并兼容OpenAI和Anthropic的API,同时更新了Harness框架。定价与V4-Flash一致,单次请求最多可处理600张图像。
DeepSeek于8月21日发布多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp,并上线API平台,支持图像理解,单张图片最高费用0.001152元。该模型在视觉Agent基准上接近Opus 4.8,同时兼容多种API格式,并推出免费的Files API。此举补齐了DeepSeek在多模态API方面的空白,可能降低多模态应用的成本门
本文是一篇立场论文,认为具有思维链推理能力的AI智能体容易表现出合谋行为,应在影响经济市场决策前获得行为认证。实验使用DeepSeek-R1智能体在Bertrand寡头定价领域发现隐性合谋倾向,即使人类提示不要合谋也持续存在,且思维链可被引导至极端合谋或竞争行为而无法被其他LLM语义检测。作者认为部署推理智能体进行市场决策会导致合谋经济结果而无共谋证据,因此
DeepSeek 发布了 DeepSeek Harness (dsh) 的开发者预览版,这是一个基于 MIT 许可证的开源执行运行时,用于构建自主 AI 代理。该软件采用微内核架构,基于 Cordis 元框架构建,将模型适配器、工具注册表、沙箱环境等作为独立插件加载,支持通过 YAML 或 JSON 配置切换模型端点和执行工作流。平台还包含仅追加的事件日志子
DeepSeek 于 8 月 17 日上调 V4 Pro API 价格,其中缓存命中价格在高峰时段涨幅高达 11 倍,从 0.025 元/百万 Token 涨至 0.3 元/百万 Token。涨价原因是长上下文需求激增导致后端缓存颠簸,存储、IO 和调度成本上升。文章分析了 DeepSeek 的 KV 压缩和冷热分层技术,并对比了 Anthropic 和 O
诺基亚计划关闭杭州研发中心并裁员1600人,因中国业务持续下滑。DeepSeek API峰谷定价方案生效,高峰时段价格翻倍。苹果与阿里合作深化,阿里参与训练面向中国市场的更强模型。Claude出现大规模服务故障,影响Claude.ai、Claude Code等服务。
Deepseek 发布了 V4-Pro 模型的更新版本(V4-Pro-0813),在代理基准测试中得分显著提升,但仍落后于 Claude Opus 5 等顶级模型。同时,公司开源了其代理软件 Deepseek Harness(MIT 许可),并提高了 API 价格,尤其是缓存命中的费用。这些举措发生在公司融资和准备 IPO 的背景下。
DeepSeek正式发布并开源了DeepSeek Harness(DSH),这是一款为自进化与DIY设计的Agent框架,采用Cordis插件架构,一切皆可插拔,内置超100个插件。实测显示DSH在长程任务能力上表现优于Codex,但UI细节仍有差距。DSH被视为Agent时代的安卓,旨在通过开放生态推动AI自进化。
DeepSeek V4 Pro 发布后,其 Harness 内测入选项目名单疑似曝光,显示其重点扶持安全、路由、端侧控制、多智能体协作等 Agent 基础设施项目,而非高星通用工具。此举旨在补齐执行层安全、工程可靠性和商业化 ROI 短板,推动从 API 提供商向工业级 Agent 生产线转型。
DeepSeek发布了V4 Pro正式版,API平台已更新至DeepSeek-V4-Pro-0813,多项基准测试显示其Agent能力接近或超越Fable 5和Opus 4.8。价格与预览版持平,但网友发现其思维链输出变得简略,可能影响写作能力。该发布被视为国产开源模型在性价比之外向SOTA发起冲击的标志。
xAI 发布了 Grok 4.6 模型,该模型在知识工作领域表现优异,价格远低于同类前沿模型,并已集成到 Cursor 和 SpaceX 团队的产品中。同日,阿里发布开源模型 Qwen3.8-Max,DeepSeek 推出 V4 Pro GA,微软也发布了自研推理模型 MAI-Thinking-1。这些发布标志着 AI 助手和知识工作领域的竞争加剧。
本期资讯涵盖多个AI相关动态:美国政府解除联邦设备上TikTok的使用限制,因TikTok美国业务重组后不再构成安全威胁;DeepSeek发布V4 Pro正式版API,增强Agent能力;阿里开源Qwen3.8-2.4T-A95B模型权重;腾讯发布二季报,AI投入加大;小红书打造AI导购功能;宇树科技IPO中签率创科创板新低。