返回全部动态

DeepSeek V4 多模态开源:视觉链路深度拆解

原标题:DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍

雷峰网 AI科技评论开源质量 81

AI 摘要

DeepSeek 开放了 V4 多模态模型的权重和推理代码,揭示了其视觉处理链路:通过 32 层 ViT 编码图像,使用 Aligner 将视觉特征压缩并映射到语言空间,视觉 Token 直接融入 V4 主干参与 Attention 和 MoE 路由。该设计针对 Agent 场景优化,支持长上下文和工具调用,但面临重复计算和视觉状态管理的挑战。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

0 作者丨郑佳美 编辑丨岑 峰 这不是一个全新的模型突然出现。早在 8 月 21 日,DeepSeek 就已经把它接入 API,当时外界只能看到结果:V4 开始能处理图片,而且在 ApexBench、Agents' Last Exam、Chartography 等多模态 Agent 基准上整体提升。 现在不一样了。 随着权重和参考推理代码公开,V4 的视觉部分第一次可以直接拆开看。Vision Encoder 怎么处理图片,Aligner 怎么把视觉特征压进语言空间,视觉 Token 怎么进入 DFlash,MoE 又怎么给图片选择专家,这些东西都已经暴露出来。 拆完代码会发现,DeepSeek 做的并不是简单给 V4 接一个看图模块。 图片经过视觉编码以后,会被直接塞进 V4 原有的 Token 序列,继续参与长上下文 Attention、MoE 路由和后面的 Agent 推理。甚至连注意力窗口和专家路由,都专门为视觉 Token 改了规则。 所以这次开放权重之后,更值得研究的问题已经从 V4 会不会看图,变成了另一件事: DeepSeek 到底是怎么把视觉塞进一个原本为长上下文和


发布时间:2026-09-01 18:38
抓取时间:2026-09-01 21:08
来源机构:雷峰网
阅读原文leiphone.com