核心观点与关键数据
- DeepSeek-V4系列模型发布:DeepSeek最新模型V4预览版本正式上线并开源,包括DeepSeek-V4-Pro(总参数量1.6万亿,激活参数490亿)和DeepSeek-V4-Flash(总参数量2840亿,激活参数130亿),两者均支持长达一百万token的上下文长度。
- 技术提升:DeepSeek-V4系列在架构与优化方面进行了多项关键升级,包括混合注意力架构CSA+HCA、新型残差连接架构mHC、Muon优化器、FP4量化感知训练(QAT)、后训练专家独立训练+on-policy distillation统一蒸馏,以及基础设施层面的创新。
- 长上下文优化:通过混合注意力架构CSA+HCA,DeepSeek-V4在100万token场景下,单token推理FLOPs仅为DeepSeek-V3.2的27%,KV缓存仅为其10%,有效降低长上下文下的计算成本。
- 模型表现:DeepSeek-V4-Pro Max在Artificial Analysis Intelligence Index中得分52分,进入全球最强模型阵营;在Artificial Analysis Coding Index中得分为47,仅次于Claude最新模型;在Artificial Analysis Agentic Index中得分为67,仅次于GPT-5.5 Thinking。
- 性价比优势:DeepSeek-V4系列价格优势非常明显,每百万tokens调用价格仅为输入0.14美元,输出0.28美元,仅为OpenAI和Claude旗舰模型的约1/18至1/100。
- 国产算力适配:DeepSeek-V4推理算力需求明显提升,有望刺激国产算力用量,预计下半年Pro价格会大幅下调。
研究结论
- 综合能力提升:DeepSeek-V4已经具备接近全球第一梯队的综合能力,同时通过极具竞争力的价格体系,打开了大规模企业级AI Agent落地的商业空间。
- 长上下文训练方向:其在长上下文训练中的优化为基础模型的进步提供了全新的方向,后续百万上下文有望成为前沿模型的标配。
- 国产算力推动:DeepSeek-V4在国产算力方面积极适配,有望推动整体国产算力需求增长。
- 风险提示:下游需求不及预期、AI应用落地不及预期、硬件技术落地进程不及预期、宏观经济波动等。
模型技术细节
- 混合注意力架构CSA+HCA:CSA先把KV沿序列维压缩,再做稀疏选择;HCA则用更激进的压缩,但保留dense attention。两者交替使用,兼顾局部依赖、全局检索能力和极端长序列下的成本控制。
- 新型残差连接架构mHC:把残差映射矩阵约束到doubly stochastic manifold上,使其谱范数受限、残差传播变成non-expansive,从而改善深层训练稳定性。
- Muon优化器:把更新方向整理得更规整、更稳定,大模型训练收敛更快。
- FP4量化感知训练(QAT):训练时就模拟量化,让模型提前适应低精度误差,部署时性能更稳。
- 后训练专家独立训练+on-policy distillation统一蒸馏:先分别培养数学、代码、agent、instruction-following等领域专家,再通过on-policy distillation把这些能力蒸馏回一个统一模型。
- 基础设施层面创新:MoE中把通信、计算、访存做成单融合kernel;更细粒度的expert wave调度来隐藏通信开销。
模型表现与风险
- 幻觉问题:DeepSeek-V4在AA-Omniscience的非幻觉率测评中表现偏低,更倾向于尝试作答,而不是在不确定时拒绝回答。
- 风险提示:下游需求不及预期、AI应用落地不及预期、硬件技术落地进程不及预期、宏观经济波动等。