DeepSeek-V4 结合 CSA + HCA 混合注意力、流形约束超连接(mHC)和 Muon 优化器。报告显示,在 1M token 上下文下,Pro 的单 token 推理 FLOPs 为 V3.2 的 27%,KV Cache 为 10%。
论文信息
- 作者: DeepSeek-AI
- 发布: 2026-06(preview 版本)
- 论文: DeepSeek_V4.pdf
- 模型: HuggingFace Collections
- 篇幅: 58 页
核心问题
标准 Attention 的计算量随序列长度平方增长,限制了长上下文和推理时扩展。V4 通过压缩 KV 并混合使用稀疏与稠密注意力,降低这部分开销。
1. 模型规格
| 规格 | DeepSeek-V4-Pro | DeepSeek-V4-Flash |
|---|---|---|
| 总参数 | 1.6T | 284B |
| 激活参数 | 49B | 13B |
| 上下文长度 | 1M tokens | 1M tokens |
| 预训练数据 | 33T tokens | 32T tokens |
| MoE | DeepSeekMoE | DeepSeekMoE |
| 路由激活函数 | Sqrt(Softplus) | Sqrt(Softplus) |
推理效率对比(vs V3.2,1M token 上下文):
| 指标 | V3.2 | V4-Pro | V4-Flash |
|---|---|---|---|
| 单 token 推理 FLOPs | 基准 | 27% | 10% |
| KV Cache 大小 | 基准 | 10% | 7% |
2. 架构创新
2.1 混合注意力:CSA + HCA(§2.3,核心创新)
这一架构变动通过压缩 KV,减少 Attention 的计算量。
Compressed Sparse Attention (CSA)
核心思路:先压缩 KV,再做稀疏注意力。
原始序列 → KV 沿序列维度压缩 → 压缩后的 KV → DSA(DeepSeek Sparse Attention)- KV 先沿序列维度压缩(类似 Downsampling),减少 key/value 数量
- 然后在压缩后的 KV 上执行 DSA(V3 已有的稀疏注意力机制)
- 效果:序列维度的计算和缓存大幅缩减
Heavily Compressed Attention (HCA)
核心思路:更激进的压缩,但保持稠密注意力。
原始序列 → KV 更激进压缩 → 极少量 KV → Dense Attention- 对 KV 施加比 CSA 更强的压缩比
- 但在压缩后的 KV 上做全量稠密注意力(不是稀疏选择)
- 适用场景:对精度要求不高但对效率极度敏感的层
混合策略
不同层采用不同的注意力方式:
| 注意力类型 | 压缩程度 | 注意力方式 | 信息保留 |
|---|---|---|---|
| CSA | 中度压缩 | 稀疏(选择性) | 高精度 |
| HCA | 重度压缩 | 稠密(全量) | 概要级 |
| 标准 DSA(V3) | 无压缩 | 稀疏 | 完整 |
CSA 与 HCA 的层分配由实验确定;本文所依据的资料未给出具体方案。
与 SSA(SubQ)的对比
| 维度 | DeepSeek V4 CSA+HCA | SubQ/SSA |
|---|---|---|
| 核心思想 | 先压缩 KV → 再做注意力 | 内容依赖选择相关 K |
| 复杂度类 | 压缩后亚二次 | 亚二次(线性) |
| 信息损失 | 压缩步骤有损 | 选择性无损 |
| 生产部署 | ✅ 已大规模部署 | ⚠️ 尚在早期 |
| 1M token 效率 | FLOPs 27% vs V3.2 | FLOPs ~1.5% vs FlashAttn |
SSA 页面有更详细的对比分析。
2.2 Manifold-Constrained Hyper-Connections (mHC)(§2.2)
动机:标准残差连接()和 Hyper-Connections(可学习连接权重)存在训练稳定性问题。
mHC 的核心思路:
- Hyper-Connections 通过扩展残差流宽度丧失了恒等映射(identity mapping),导致训练不稳定和可扩展性受限
- mHC 将残差映射约束到特定流形,恢复恒等映射性质
- 同时保持模型表达能力
三种连接:
| 类型 | 公式形式 | 特点 |
|---|---|---|
| 残差连接 | 恒等映射默认但有梯度消失/表示坍缩跷跷板 | |
| Hyper-Connections | 可学习权重连接 | 灵活但丧失恒等映射 |
| mHC | 流形约束的可学习连接 | 兼顾灵活性与恒等映射稳定性 |
2.3 DeepSeekMoE 变更(§2.1, §3)
与 V3 的 MoE 相比,V4 的变更:
| 方面 | V3 | V4 |
|---|---|---|
| 路由激活函数 | Sigmoid | Sqrt(Softplus) |
| 负载均衡 | auxiliary-loss-free + 轻微序列级平衡损失 | 同 V3 |
| 路由目标节点 | 有数量限制 | 取消限制 |
| 前几层 FFN | 稠密 | Hash routing MoE |
| 专家权重精度 | — | FP4 量化感知训练 |
Hash routing:前几层改用 Hash 函数根据 input token ID 确定路由目标,简单高效。
2.4 Muon 优化器(§2.4, §3.4.1)
- 基于 matrix orthogonality(矩阵正交性)的优化器
- 大规模训练需要两个关键改动:添加 Weight Decay + 逐参数更新尺度调整
- 比 AdamW 约 2× 计算效率(Scaling law)
- 分布式实现采用 ZeRO-1 风格,与 EP 兼容
- mHC 的实现通过重计算(recomputation)和融合 kernel 降低显存开销
3. 基础设施(§3)
3.1 MoE 通信-计算重叠(§3.1)
详见 并行策略页面。
核心要点:
- Waved-EP:将 experts 拆成多波(waves),dispatch/compute/combine 交替重叠
- 单个 MoE 层 1.96× 加速,端到端 1.71×
- 需要 20 个 SM 专用 PTX 通信 kernel,绕过 NCCL
3.2 TileLang(§3.2)
- DSL 层面的编程语言,平衡开发效率与运行性能
- <70 行 Python 表达多种 AI 算法,代码量减少 85.5%
- H100 上 3.02× 平均加速 vs Triton
- 核心理念:Tile-level 数据流图(FTG)+ 硬件感知默认值 + 约束传播自动补全
3.3 确定性 kernel 库(§3.3)
- 批次不变(batch-invariant)且确定性的 kernel
- 跨训练和推理的逐位可复现性
- 对 RL 训练的可重复性至关重要
3.4 训练框架(§3.4)
| 组件 | 关键技术 |
|---|---|
| Muon 分布式 | ZeRO-1 风格分布,与 EP 兼容 |
| mHC 效率 | 重计算 + 融合 kernel 降低显存 |
| 上下文并行 | 两阶段 CP 处理压缩注意力 |
| 激活检查点 | 张量级扩展自动微分,细粒度重计算控制 |
3.5 推理框架(§3.5)
KV Cache 管理创新:
- 异构 KV Cache 结构:不同层/不同注意力类型使用不同压缩比的 KV
- On-disk KV Cache 存储:支持共享前缀复用(类似 prefix caching)
- 压缩后 KV 可持久化到磁盘,按需加载
4. 预训练(§4)
4.1 数据构造(§4.1)
- 32T(Flash)/ 33T(Pro)高质量多样 tokens
- 数据构造细节论文未详细公开
4.2 训练设置(§4.2)
| 设置 | Pro | Flash |
|---|---|---|
| 参数量 | 1.6T | 284B |
| 激活参数 | 49B | 13B |
| 训练 tokens | 33T | 32T |
| 上下文 | 1M(原生支持) | 1M(原生支持) |
4.3 训练稳定性(§4.2.3)
- 使用 Muon 优化器提升了训练稳定性
- mHC 的流形约束也有助于稳定训练
- 论文提到有专门的训练不稳定性缓解策略,但未详细公开
4.4 预训练评估(§4.3)
V4-Flash-Base 在大多数 benchmark 上已超越 V3.2-Base。V4-Pro-Base 进一步在推理、编码、长上下文和世界知识任务上全面领先。
5. 后训练(§5)
5.1 后训练流程:两阶段范式
阶段1: 分领域独立专家训练├── 数学专家: SFT → GRPO RL├── 编码专家: SFT → GRPO RL├── Agent 专家: SFT → GRPO RL├── 指令跟随专家: SFT → GRPO RL└── ...更多领域 │ ▼阶段2: On-Policy Distillation 统一合并├── 统一模型作为学生├── 各领域专家作为教师└── 优化 Reverse KL 散度为什么不直接联合训练?
- 不同领域的 RL 奖励信号冲突
- 专家可以独立迭代,互不干扰
- 蒸馏阶段统一整合,保持各领域优势
On-Policy Distillation 的优势
| 方法 | 成本 | 行为保持 |
|---|---|---|
| SFT(off-policy) | 低 | 差,行为偏移大 |
| RL | 极高 | 好 |
| On-Policy Distillation | 中(9-30× 低于 SFT) | 好,Reverse KL 保持多样性 |
5.2 后训练基础设施(§5.2)
- FP4 量化感知训练:MoE 专家权重和 indexer QK 路径的 FP4 QAT,降低内存和计算
- 高效教师调度:全词表 OPD 的教师调度优化
- 可抢占/容错 Rollout 服务:支持 RL 训练中的动态资源回收
- 百万 token 上下文 RL 扩展:专门处理超长 RL 上下文
- Sandbox 基础设施:Agent 任务的安全沙箱环境
6. 评估结果(§5.3-§5.4)
6.1 知识与推理
| Benchmark | V4-Pro-Max | Claude-Opus-4.6-Max | GPT-5.4-xHigh | Gemini-3.1-Pro-High |
|---|---|---|---|---|
| SimpleQA Verified | 57.9 | 46.2 | 45.3 | — |
| HLE | 37.7 | 40.0 | 39.8 | — |
| MMLU-Pro | — | — | — | — |
关键结论:
- V4-Pro-Max 在 SimpleQA 和中文知识上显著领先开源对手
- 在数学推理上优于 GPT-5.2 和 Gemini-3.0-Pro,略逊 GPT-5.4 和 Gemini-3.1-Pro
- V4-Flash-Max 在推理任务上接近 GPT-5.2 水平,推理成本较低
6.2 Agent 能力
| Benchmark | V4-Pro-Max | Kimi-K2.6 | GLM-5.1 | Claude Opus 4.5 |
|---|---|---|---|---|
| SWE Verified | 44.4 | — | — | 37.7/40.0 |
| Terminal Bench 2.0 | — | — | — | — |
| Toolathlon | 80.6 | 80.8 | 78.1 | 89.1 |
内部评测:超越 Claude Sonnet 4.5,接近 Opus 4.5 水平。
6.3 长上下文(1M token)
- 在学术 benchmark 上超越 Gemini-3.1-Pro
- 1M token 上下文下推理 FLOPs 仅 V3.2 的 27%
- KV Cache 仅 V3.2 的 10%
- 原生支持,不需要额外的上下文扩展训练
6.4 中文写作(内部评测)
| 类别 | V4-Pro vs Gemini-3.1-Pro |
|---|---|
| 商务写作 | V4 胜 65.16% |
| 媒体写作 | V4 胜 57.96% |
| 日常写作 | V4 胜 69.49% |
| 口头文本 | V4 胜 58.62% |
| 公文文本 | V4 胜 54.78% |
| 学术写作 | V4 胜 63.43% |
| 总计 | V4 胜 62.65% |
6.5 Agentic Search vs RAG
在搜索任务上,Agent 模式 vs RAG 模式:
| 指标 | Agent Search | RAG |
|---|---|---|
| 胜率 | 61.7% | 18.3% |
| 平均 Tool Calls | 16.2 | — |
| 平均 Prefill | 13,649 | 10,453 |
7. 核心洞察
CSA + HCA 降低了百万 token 上下文的计算和缓存需求,为长推理链与长期 Agent 任务提供了更低成本的实现方式。
混合注意力让不同层采用不同压缩强度,在信息保留与效率之间取舍。
后训练先分领域训练专家(SFT → GRPO RL),再用 On-Policy Distillation 合并,有助于减少多领域奖励冲突。相关蒸馏实验报告的成本为纯 RL 的 1/50–1/100。
8. 局限与开放问题
- 层分配方案未公开:CSA/HCA 在各层的具体分配比例和策略是关键工程细节,论文未详细公开
- HCA 的信息损失:更激进的压缩必然丢失信息,论文未量化这种损失的具体影响
- 与 Gemini-3.1-Pro 差距:在知识评测上仍落后 Google 最佳模型
- Agent 能力:在公开 benchmark 上与开源模型持平,但略逊闭源前沿模型
- FP4 精度:虽然降低内存,但当前硬件的 FP4×FP8 操作峰值 FLOPs 与 FP8×FP8 相同,理论优势尚未实现
9. 与相关工作的关系
| 方法 | 缓存/压缩什么 | 与 V4 区别 |
|---|---|---|
| SSA (SubQ) | 内容依赖选择相关 K | 无损精确检索,但尚未大规模部署 |
| DeepSeek V3 DSA | 闪电索引器 + 稀疏选择 | 索引器本身仍是 O(n²) |
| Mamba/SSM | 压缩为隐状态 | 线性但远距离信息不可恢复 |
| V4 CSA | 先压缩 KV 再稀疏选择 | 有损压缩但大幅降低计算 |
| V4 HCA | 更激进压缩但稠密注意力 | 概要级信息保留 |
| 优化器 | 特点 | 与 V4 区别 |
|---|---|---|
| AdamW | 自适应学习率 + 权重衰减 | 标准选择,收敛效率低于 Muon |
| Muon | 矩阵正交性优化 | V4 采用,约 2× 计算效率 |
| 训练范式 | 特点 | V4 采用 |
|---|---|---|
| SFT → RL | 端到端统一训练 | ❌ 多领域奖励冲突 |
| 领域 SFT → 领域 RL → OPD 统一 | 分领域独立后蒸馏合并 | ✅ V4 后训练策略 |