2524 字
13 分钟
DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence

DeepSeek-V4 结合 CSA + HCA 混合注意力、流形约束超连接(mHC)和 Muon 优化器。报告显示,在 1M token 上下文下,Pro 的单 token 推理 FLOPs 为 V3.2 的 27%,KV Cache 为 10%。

论文信息#

核心问题#

标准 Attention 的计算量随序列长度平方增长,限制了长上下文和推理时扩展。V4 通过压缩 KV 并混合使用稀疏与稠密注意力,降低这部分开销。


1. 模型规格#

规格DeepSeek-V4-ProDeepSeek-V4-Flash
总参数1.6T284B
激活参数49B13B
上下文长度1M tokens1M tokens
预训练数据33T tokens32T tokens
MoEDeepSeekMoEDeepSeekMoE
路由激活函数Sqrt(Softplus)Sqrt(Softplus)

推理效率对比(vs V3.2,1M token 上下文):

指标V3.2V4-ProV4-Flash
单 token 推理 FLOPs基准27%10%
KV Cache 大小基准10%7%

2. 架构创新#

2.1 混合注意力:CSA + HCA(§2.3,核心创新)#

这一架构变动通过压缩 KV,减少 Attention 的计算量。

Compressed Sparse Attention (CSA)#

核心思路:先压缩 KV,再做稀疏注意力。

原始序列 → KV 沿序列维度压缩 → 压缩后的 KV → DSA(DeepSeek Sparse Attention)
  • KV 先沿序列维度压缩(类似 Downsampling),减少 key/value 数量
  • 然后在压缩后的 KV 上执行 DSA(V3 已有的稀疏注意力机制)
  • 效果:序列维度的计算和缓存大幅缩减

Heavily Compressed Attention (HCA)#

核心思路:更激进的压缩,但保持稠密注意力。

原始序列 → KV 更激进压缩 → 极少量 KV → Dense Attention
  • 对 KV 施加比 CSA 更强的压缩比
  • 但在压缩后的 KV 上做全量稠密注意力(不是稀疏选择)
  • 适用场景:对精度要求不高但对效率极度敏感的层

混合策略#

不同层采用不同的注意力方式:

注意力类型压缩程度注意力方式信息保留
CSA中度压缩稀疏(选择性)高精度
HCA重度压缩稠密(全量)概要级
标准 DSA(V3)无压缩稀疏完整

CSA 与 HCA 的层分配由实验确定;本文所依据的资料未给出具体方案。

与 SSA(SubQ)的对比#

维度DeepSeek V4 CSA+HCASubQ/SSA
核心思想先压缩 KV → 再做注意力内容依赖选择相关 K
复杂度类压缩后亚二次亚二次(线性)
信息损失压缩步骤有损选择性无损
生产部署✅ 已大规模部署⚠️ 尚在早期
1M token 效率FLOPs 27% vs V3.2FLOPs ~1.5% vs FlashAttn

SSA 页面有更详细的对比分析。

2.2 Manifold-Constrained Hyper-Connections (mHC)(§2.2)#

动机:标准残差连接(x+f(x)x + f(x))和 Hyper-Connections(可学习连接权重)存在训练稳定性问题。

mHC 的核心思路:

  1. Hyper-Connections 通过扩展残差流宽度丧失了恒等映射(identity mapping),导致训练不稳定和可扩展性受限
  2. mHC 将残差映射约束到特定流形,恢复恒等映射性质
  3. 同时保持模型表达能力

三种连接:

类型公式形式特点
残差连接x+f(x)x + f(x)恒等映射默认但有梯度消失/表示坍缩跷跷板
Hyper-Connections可学习权重连接灵活但丧失恒等映射
mHC流形约束的可学习连接兼顾灵活性与恒等映射稳定性

2.3 DeepSeekMoE 变更(§2.1, §3)#

与 V3 的 MoE 相比,V4 的变更:

方面V3V4
路由激活函数SigmoidSqrt(Softplus)
负载均衡auxiliary-loss-free + 轻微序列级平衡损失同 V3
路由目标节点有数量限制取消限制
前几层 FFN稠密Hash routing MoE
专家权重精度—FP4 量化感知训练

Hash routing:前几层改用 Hash 函数根据 input token ID 确定路由目标,简单高效。

2.4 Muon 优化器(§2.4, §3.4.1)#

  • 基于 matrix orthogonality(矩阵正交性)的优化器
  • 大规模训练需要两个关键改动:添加 Weight Decay + 逐参数更新尺度调整
  • 比 AdamW 约 2× 计算效率(Scaling law)
  • 分布式实现采用 ZeRO-1 风格,与 EP 兼容
  • mHC 的实现通过重计算(recomputation)和融合 kernel 降低显存开销

3. 基础设施(§3)#

3.1 MoE 通信-计算重叠(§3.1)#

详见 并行策略页面。

核心要点:

  • Waved-EP:将 experts 拆成多波(waves),dispatch/compute/combine 交替重叠
  • 单个 MoE 层 1.96× 加速,端到端 1.71×
  • 需要 20 个 SM 专用 PTX 通信 kernel,绕过 NCCL

3.2 TileLang(§3.2)#

  • DSL 层面的编程语言,平衡开发效率与运行性能
  • <70 行 Python 表达多种 AI 算法,代码量减少 85.5%
  • H100 上 3.02× 平均加速 vs Triton
  • 核心理念:Tile-level 数据流图(FTG)+ 硬件感知默认值 + 约束传播自动补全

3.3 确定性 kernel 库(§3.3)#

  • 批次不变(batch-invariant)且确定性的 kernel
  • 跨训练和推理的逐位可复现性
  • 对 RL 训练的可重复性至关重要

3.4 训练框架(§3.4)#

组件关键技术
Muon 分布式ZeRO-1 风格分布,与 EP 兼容
mHC 效率重计算 + 融合 kernel 降低显存
上下文并行两阶段 CP 处理压缩注意力
激活检查点张量级扩展自动微分,细粒度重计算控制

3.5 推理框架(§3.5)#

KV Cache 管理创新:

  • 异构 KV Cache 结构:不同层/不同注意力类型使用不同压缩比的 KV
  • On-disk KV Cache 存储:支持共享前缀复用(类似 prefix caching)
  • 压缩后 KV 可持久化到磁盘,按需加载

4. 预训练(§4)#

4.1 数据构造(§4.1)#

  • 32T(Flash)/ 33T(Pro)高质量多样 tokens
  • 数据构造细节论文未详细公开

4.2 训练设置(§4.2)#

设置ProFlash
参数量1.6T284B
激活参数49B13B
训练 tokens33T32T
上下文1M(原生支持)1M(原生支持)

4.3 训练稳定性(§4.2.3)#

  • 使用 Muon 优化器提升了训练稳定性
  • mHC 的流形约束也有助于稳定训练
  • 论文提到有专门的训练不稳定性缓解策略,但未详细公开

4.4 预训练评估(§4.3)#

V4-Flash-Base 在大多数 benchmark 上已超越 V3.2-Base。V4-Pro-Base 进一步在推理、编码、长上下文和世界知识任务上全面领先。


5. 后训练(§5)#

5.1 后训练流程:两阶段范式#

阶段1: 分领域独立专家训练
├── 数学专家: SFT → GRPO RL
├── 编码专家: SFT → GRPO RL
├── Agent 专家: SFT → GRPO RL
├── 指令跟随专家: SFT → GRPO RL
└── ...更多领域
│
▼
阶段2: On-Policy Distillation 统一合并
├── 统一模型作为学生
├── 各领域专家作为教师
└── 优化 Reverse KL 散度

为什么不直接联合训练?#

  • 不同领域的 RL 奖励信号冲突
  • 专家可以独立迭代,互不干扰
  • 蒸馏阶段统一整合,保持各领域优势

On-Policy Distillation 的优势#

方法成本行为保持
SFT(off-policy)低差,行为偏移大
RL极高好
On-Policy Distillation中(9-30× 低于 SFT)好,Reverse KL 保持多样性

5.2 后训练基础设施(§5.2)#

  • FP4 量化感知训练:MoE 专家权重和 indexer QK 路径的 FP4 QAT,降低内存和计算
  • 高效教师调度:全词表 OPD 的教师调度优化
  • 可抢占/容错 Rollout 服务:支持 RL 训练中的动态资源回收
  • 百万 token 上下文 RL 扩展:专门处理超长 RL 上下文
  • Sandbox 基础设施:Agent 任务的安全沙箱环境

6. 评估结果(§5.3-§5.4)#

6.1 知识与推理#

BenchmarkV4-Pro-MaxClaude-Opus-4.6-MaxGPT-5.4-xHighGemini-3.1-Pro-High
SimpleQA Verified57.946.245.3—
HLE37.740.039.8—
MMLU-Pro————

关键结论:

  • V4-Pro-Max 在 SimpleQA 和中文知识上显著领先开源对手
  • 在数学推理上优于 GPT-5.2 和 Gemini-3.0-Pro,略逊 GPT-5.4 和 Gemini-3.1-Pro
  • V4-Flash-Max 在推理任务上接近 GPT-5.2 水平,推理成本较低

6.2 Agent 能力#

BenchmarkV4-Pro-MaxKimi-K2.6GLM-5.1Claude Opus 4.5
SWE Verified44.4——37.7/40.0
Terminal Bench 2.0————
Toolathlon80.680.878.189.1

内部评测:超越 Claude Sonnet 4.5,接近 Opus 4.5 水平。

6.3 长上下文(1M token)#

  • 在学术 benchmark 上超越 Gemini-3.1-Pro
  • 1M token 上下文下推理 FLOPs 仅 V3.2 的 27%
  • KV Cache 仅 V3.2 的 10%
  • 原生支持,不需要额外的上下文扩展训练

6.4 中文写作(内部评测)#

类别V4-Pro vs Gemini-3.1-Pro
商务写作V4 胜 65.16%
媒体写作V4 胜 57.96%
日常写作V4 胜 69.49%
口头文本V4 胜 58.62%
公文文本V4 胜 54.78%
学术写作V4 胜 63.43%
总计V4 胜 62.65%

6.5 Agentic Search vs RAG#

在搜索任务上,Agent 模式 vs RAG 模式:

指标Agent SearchRAG
胜率61.7%18.3%
平均 Tool Calls16.2—
平均 Prefill13,64910,453

7. 核心洞察#

CSA + HCA 降低了百万 token 上下文的计算和缓存需求,为长推理链与长期 Agent 任务提供了更低成本的实现方式。

混合注意力让不同层采用不同压缩强度,在信息保留与效率之间取舍。

后训练先分领域训练专家(SFT → GRPO RL),再用 On-Policy Distillation 合并,有助于减少多领域奖励冲突。相关蒸馏实验报告的成本为纯 RL 的 1/50–1/100。


8. 局限与开放问题#

  1. 层分配方案未公开:CSA/HCA 在各层的具体分配比例和策略是关键工程细节,论文未详细公开
  2. HCA 的信息损失:更激进的压缩必然丢失信息,论文未量化这种损失的具体影响
  3. 与 Gemini-3.1-Pro 差距:在知识评测上仍落后 Google 最佳模型
  4. Agent 能力:在公开 benchmark 上与开源模型持平,但略逊闭源前沿模型
  5. FP4 精度:虽然降低内存,但当前硬件的 FP4×FP8 操作峰值 FLOPs 与 FP8×FP8 相同,理论优势尚未实现

9. 与相关工作的关系#

方法缓存/压缩什么与 V4 区别
SSA (SubQ)内容依赖选择相关 K无损精确检索,但尚未大规模部署
DeepSeek V3 DSA闪电索引器 + 稀疏选择索引器本身仍是 O(n²)
Mamba/SSM压缩为隐状态线性但远距离信息不可恢复
V4 CSA先压缩 KV 再稀疏选择有损压缩但大幅降低计算
V4 HCA更激进压缩但稠密注意力概要级信息保留
优化器特点与 V4 区别
AdamW自适应学习率 + 权重衰减标准选择,收敛效率低于 Muon
Muon矩阵正交性优化V4 采用,约 2× 计算效率
训练范式特点V4 采用
SFT → RL端到端统一训练❌ 多领域奖励冲突
领域 SFT → 领域 RL → OPD 统一分领域独立后蒸馏合并✅ V4 后训练策略
DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence
https://blog.lpkt.cn/posts/papers/deepseek-v4/
作者
lollipopkit
发布于
2026-06-07
许可协议
CC BY-NC-SA 4.0