返回全部动态

深度解读 DeepSeek V4.1 Flash 全新架构,如何成为显存杀手

雷峰网 AI科技评论模型发布质量 73

AI 摘要

DeepSeek 上线 V4.1-Flash,采用因果编码器-解码器(CED)、第二代压缩稀疏注意力(CSA2)与三档推理力度旋钮的全新架构,针对长上下文场景重写。该架构将运行时显存占用降低约 3/4,落盘持久 KV 缓存降至上一代的 1/8,KV 缓存最高暴降 437 倍,使百万 Token 级长上下文进入工业级生产力阶段。模型主干 552B 参数、外挂 196B Engram 记忆模块,预填充仅激活 8B、解码激活 16B,却在 DeepSWE v1.1 拿到 74.2% 通过率,超越 Opus-5.0 与 GPT-5.6-Sol,并在 CyberGym 取得开源 SOTA。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

KV 缓存暴降 437 倍,Agent 成本大洗牌。     作者丨高允毅     编辑丨岑   峰                                                                                                         刚刚 DeepSeek V4.1-Flash 上线,最值得关注的是它的全新架构。这是一次针对长上下文场景的架构重写。过去,更强的智力往往意味着更庞大的算力,超长上下文背后是极高的硬件需求。但DeepSeek 这次用因果编码器-解码器架构 Causal-Encoder-Decoder(CED)、第二代压缩稀疏注意力Compressed Sparse Attention 2(CSA2)和 low / high / max 三档可调推理力度旋钮,打破了这一潜规则。能让 DeepSeek V4.1-Flash 以极低的成本,在不少评测中,智力超越上一代 DeepSeek V4-Pro。这套新架构把大模型的“记忆体积”压缩到了极致,运行时的显存占用直接砍掉了3/4,存进硬盘的长期记忆更是只占


发布时间:2026-09-10 19:00
抓取时间:2026-09-10 22:09
来源机构:雷峰网
阅读原文leiphone.com