您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [财通证券]:DeepSeek 开源六连击:尽显极客风采 - 发现报告

DeepSeek 开源六连击:尽显极客风采

信息技术 2025-03-02 董升 财通证券 土豆不吃泥
报告封面

证券研究报告 投资评级:看好(维持) 核心观点 DeepSeek开源周:更大的吞吐,更低的延迟,更极致的性价比。DeepSeek在2月24日至28日进行了为期5天的开源周“技术轰炸”,开源了5大代码库,覆盖训练、推理、通信、负载均衡以及数据加速的全链路,惊喜连连。开源周第1天发布FlashMLA,一款专为Hopper架构打造的高效MLA解码器,可高效处理变长序列,优化内存管理,榨取GPU极致性能。开源周第2天发布DeepEP,聚焦通信资源利用,提升数据高效传输,是首个为MoE量身定制的灵活GPU资源控制通信库。开源周的第三天,DeepSeek推出了支持稠密和MoE模型的FP8计算库——DeepGEMM,核心逻辑仅约300行代码直面AI计算中最频繁的矩阵乘法,可为V3/R1的训练和推理提供强大支持。开源周第4天,DeepSeek推出了一系列优化并行策略,包括DualPipe——一种用于V3/R1模型训练中实现计算与通信重叠的双向流水线并行算法;以及EPLB——一个针对V3/R1模型的专家并行负载均衡工具,并深入分析了V3/R1模型中的计算与通信重叠机制。开源周的最后一天,DeepSeek发布了3FS并行文件系统,旨在应对人工智能训练和推理工作负载带来的挑战。该系统利用现代固态硬盘(SSDs)和RDMA网络,提供一个共享存储层,从而简化分布式应用程序的开发,并加速DeepSeek平台上所有数据访问操作。 分析师杨烨SAC证书编号:S0160522050001yangye01@ctsec.com 相关报告 1.《再提加强平安中国建设,重视“AI+公共安全”》2025-03-02 One More Thing:DeepSeek-V3/R1推理系统实现大模型推理545%理论成本利润率。在开源周结束5天“技术轰炸”后,DeepSeek于第6天惊喜发布关于DeepSeek-V3/R1推理系统概述的文档,展示了如何通过跨节点并行、负载均衡和动态资源管理实现高吞吐量、低延迟和高性价比的推理服务,以实现545%理论成本利润率。DeepSeek提出了三种负载均衡器:Prefill LoadBalancer、Decode Load Balancer和Expert-Parallel Load Balancer。它们分别针对不同的核心问题进行优化,目标是为每个GPU分配均衡的计算和通信负载,从而提高整体系统效率。 2.《 英 伟 达 业 绩 指 引 均 超 预 期 ,Blackwell增长强劲》2025-02-27 3.《一文解读智能驾驶“端到端2.0”-VLA模型》2025-02-27 DeepSeek开源六连击,尽显极客风采:DeepSeek开源周上接连不断的技术发布,彰显了团队的极客精神和开源理念。正如其官方所言:“这里没有象牙塔,只有秉持纯粹的车库创业精神和社区驱动的创新理念。”此次FlashMLA项目中同样包含了一行内联代码,这表明DeepSeek团队深入至高级编程语言CUDA和GPU的底层机器代码之间,对GPU的并行计算、内存访问等进行更加细致的控制,进一步提升程序的性能。这不仅体现了团队对算法的深耕,也展现了他们对效率的极致工程化追求。 ❖投资建议:我们对计算机行业维持看好评级。见正文。 ❖风险提示:技术迭代不及预期的风险;商业化落地不及预期的风险;政策支持不及预期风险;全球宏观经济风险。 内容目录 1DeepSeek开源周:更大的吞吐,更低的延迟,更极致的性价比.....................................................31.1开源周第1天:FlashMLA,专为Hopper打造的高效MLA解码器.........................................31.2开源周第2天:DeepEP,首个为MoE量身定制的灵活GPU资源控制通信库........................51.3开源周第3天:DeepGEMM,直面AI计算中最频繁的矩阵乘法..............................................71.4开源周第4天:优化并行策略,提升训练速度与资源利用率......................................................81.4.1DualPipe:创新双向流水线并行算法..............................................................................................81.4.2EPLB:优化专家并行架构训练效率................................................................................................91.4.3深入分析V3/R1模型中的计算与通信重叠机制,便于开发者理解和优化...........................101.5开源周第5天:3FS,DeepSeek数据访问推进器........................................................................112One More Thing:DeepSeek-V3/R1推理系统实现大模型推理545%理论成本利润率................133DeepSeek开源六连击,尽显极客风采...............................................................................................164投资建议.................................................................................................................................................175风险提示.................................................................................................................................................17 图表目录 图1. FlashMLA示例代码..............................................................................................................................3图2. DeepSeek-V2中MLA............................................................................................................................4图3. MoE示意图............................................................................................................................................5图4. H800上测试基于纯RDMA低延迟内核.............................................................................................6图5.标准DeepGEMM vs. MoE DeepGEMM............................................................................................7图6. DualPipe调度示例.................................................................................................................................9图7. EPLB两层混合专家(MoE)模型示例..............................................................................................9图8.训练和推理框架的分析数据...............................................................................................................11图9. GraySort基准评估smallpond............................................................................................................12图10. DeepSeek在线推理系统示意图........................................................................................................14图11. 24小时内用于推理服务的H800节点计数......................................................................................14图12.大模型推理理论成本利润率计算过程.............................................................................................15图13. 24小时内DeepSeek-V3/R1推理服务的成本和理论收入..............................................................15图14. FlashMLA中的内联PTX.................................................................................................................16 1DeepSeek开源周:更大的吞吐,更低的延迟,更极致的性价比 DeepSeek开源周圆满落幕,覆盖全链路技术环节,惊喜连连。在2月21日的开源周预告之后,DeepSeek如约在2月24日至28日进行了为期5天的“技术轰炸”,开源了5大代码库,覆盖训练、推理、通信、负载均衡以及数据加速的全链路,惊喜连连。 1.1开源周第1天:FlashMLA,专为Hopper打造的高效MLA解码器 发布FlashMLA,高效处理变长序列,优化内存管理,榨取极致性能。DeepSeek在开源周首日发布了FlashMLA技术。FlashMLA是DeepSeek专为英伟达HopperGPU开发的高效MLA(多头潜在注意力,Multi-head Latent Attention,简称MLA)解码内核,特别针对变长序列进行了优化,目前已正式投入使用。当前发布的功能包括对BF16精度的支持(保留关键精度并兼顾速度)和块大小为64的分页KV缓存(优化内存管理)。经实测,在H800 SXM5平台(CUDA 12.8)上,FlashMLA在内