DeepSeek发布V4新版本
事件:2026年4月24日,DeepSeek发布并开源全新大模型产品DeepSeekV4预览版,核心亮点为1M超长上下文能力,同时在Agent交互、世界知识储备与推理性能上全面领先。
DeepSeek发展史梳理:
- 2023年11月:发布首个开源代码大模型DeepSeekCoder和通用大模型DeepSeekLLM67B。
- 2024年1-8月:发布开源MoE模型DeepSeekMoE、DeepSeek-V2、DeepSeekCoderV2、DeepSeek-Prover-V1.5。
- 2024年12月:发布通用模型DeepSeek-V3和DeepSeek-VL2。
- 2025年1月:发布第一代推理模型DeepSeek-R1-Zero和DeepSeek-R1。
- 2025年8月:发布DeepSeek-V3.1和DeepSeek-V3.2。
- 2026年4月:发布DeepSeekV4预览版并同步开源。
DeepSeek模型架构创新:
- DeepSeekV4包含两款MoE模型:DeepSeek-V4-Pro(1.6万亿参数,主打高性能研发)和DeepSeek-V4-Flash(2840亿参数,主打轻量化、低成本落地)。
- 融合CSA与HCA混合注意力架构,显著降低长上下文推理显存占用,大幅提升推理吞吐量。
- 在1M上下文长度下,V4-Pro单Token计算量仅为V3.2的25%,KV缓存占用降至10%。
DeepSeekV4Pro性能:
- Agent能力显著增强,在AgenticCoding测评中位列开源模型第一梯队。
- 拥有完备的世界知识储备,在专项测评中大幅领先同类开源模型。
- 聚焦自主编程、工具调用、数学及STEM等高阶复杂任务,基准测试表现突出。
- 编程能力是本次迭代亮点,在SWE-bench Verified、LiveCodeBench、TerminalBench2.0测评中表现优异。
- 综合性能已比肩行业顶级闭源大模型,Agent与编程能力位居开源第一梯队,世界知识储备领先同类产品。
价格优势:
- DeepSeek-V4-Pro输入、输出价格分别为1.74美元/百万Tokens、3.48美元/百万Tokens,显著优于同级别ClaudeSonnet4.6。
- V4-Flash输入、输出价格分别为0.14美元/百万Tokens、0.28美元/百万Tokens,性价比优势突出。
国产算力厂商相继完成DeepSeek-V4系列模型的部署
适配情况:
- DeepSeekV4已在NVIDIA GPU与华为昇腾NPU双硬件平台完成细粒度专家并行(EP)方案的落地验证。
- 在通用推理场景下,相较于传统非融合基线方案,推理性能实现显著提升;针对强化学习推理、高并发智能体服务等延迟敏感型业务场景,最高可达1.92倍推理加速。
昇腾平台适配:
- 华为昇腾平台已完成全系列Day0适配,950PR/DT系列面向低时延场景实现10-20ms级推理,Atlas-A3系列面向高吞吐场景实现30ms级推理。
国产算力厂商适配:
- 寒武纪:依托自研算子库对模型核心模块专项加速,深度优化热点算子,并在vLLM框架中全面支持混合并行技术。
- 摩尔线程:在旗舰级MTTS5000 GPU上完成全链路工程化适配,原生支持FP8的硬件架构可高效匹配模型“FP4+FP8”混合精度策略。
- 沐曦股份:联合FlagOS与KernelSwift智能算子迁移系统完成Day0适配,通过核心算子优化实现国产芯片端平均3.4倍推理加速。
- 海光信息:依托自研DTK异构计算平台与集成超2000个算子的DAS软件系统,对模型实现全栈深度调优,达成业界领先的计算效率。
研究结论
- DeepSeekV4模型实现超长上下文、推理及Agent能力全面升级,叠加CSA/HCA混合注意力架构带来显著成本与性能优势。
- 华为昇腾、寒武纪、摩尔线程、沐曦股份、海光信息等国产算力厂商完成快速适配,芯模协同生态持续完善。
- 建议关注国产AI芯片产业链的投资机会。
风险提示
- 技术迭代不及预期风险。
- 商业化落地放缓风险。
- 行业竞争加剧风险。