DeepSeek开源周核心成果总结
一、开源周概述
2025年2月24日至28日,DeepSeek举行为期五天的“开源周”,连续开源五个软件库,旨在以完全透明的方式分享其在通用人工智能(AGI)领域的研究进展。五个软件库共同构筑了一个面向大规模AI的高性能基石,涵盖底层加速解码、专家并行通信、核心矩阵运算、分布式训练的流水线优化、数据处理系统的构建。
二、核心开源软件库及关键数据
1. FlashMLA:显存的“节流阀”
- 功能:专为NVIDIA Hopper架构GPU优化的高效注意力解码内核,提升大规模语言模型(LLM)推理性能,尤其在处理可变长度序列时表现突出。
- 关键数据:通过动态资源分配优化显存使用,在H800集群上达到3000GB/s的内存限制性能和580TFLOPS的计算限制性能,显存利用率提升3倍。
2. DeepEP:通信的"智能交通系统"
- 功能:首个用于MoE(混合专家模型)训练和推理的开源EP通信库,解决MoE通信瓶颈,支持优化的全对全通信模式。
- 关键数据:在Hopper H800 GPU和CX7 InfiniBand环境下,all-to-all通信带宽接近硬件上限;推理场景下延迟压缩至200微秒左右,通信性能大幅提升。
3. DeepGEMM:矩阵运算的“编译器”
- 功能:矩阵乘法加速库,为V3/R1的训练和推理提供支持,采用FP8技术实现高效计算。
- 关键数据:支持普通GEMM和MoE分组GEMM,在HopperGPU上最高可达1350+FP8TFLOPS,性能与专家调优库相当甚至在某些情况下更优,安装无需编译。
4. DualPipe和EPLB:并行训练的“指挥”
- 功能:解决大模型分布式训练中的并行调度和负载均衡问题。
- DualPipe:双向管道并行算法,实现计算与通信重叠,硬件资源利用率提升超30%。
- EPLB:专家并行负载均衡器,通过冗余专家策略和启发式分配优化GPU负载,减少闲置现象。
5. 3FS:AI专属的分布式文件系统
- 功能:专为AI训练和大数据处理设计的高性能并行分布式文件系统,提升数据访问效率。
- 关键数据:180节点集群聚合读取吞吐量达6.6TiB/s;25节点集群GraySort基准测试达3.66TiB/min;客户端节点KVCache查找峰值吞吐量40+GiB/s。
三、投资建议
建议关注以下标的:
- 办公:金山办公、合合信息、福昕软件、迈富时
- 金融:京北方、宇信科技、天阳科技、神州信息、同花顺、恒生电子、新致软件
- 大模型:科大讯飞、三六零、第四范式
- 工业:中控技术、索辰科技、鼎捷数智
- 端侧/穿戴/玩具:萤石网络、云天励飞、中科创达、汉王科技
- 医疗:润达医疗、卫宁健康、晶泰控股
- 法律:金桥信息、华宇软件、通达海
- 邮箱:彩讯股份
- 创意:万兴科技、美图公司、虹软科技
- 教育:佳发教育、欧玛软件、新开普
- 电商:焦点科技
- ERP:金蝶国际、用友网络
- OA:泛微网络、致远互联
- 安全:深信服、永信至诚
- 部署:卓易信息、优刻得、星环科技、网宿科技、汉得信息
- 算力:海光信息、寒武纪、景嘉微
四、风险提示
- 商业化后表现不及预期
- 用户付费意愿低
- 行业技术迭代速度较快
五、研究结论
DeepSeek通过开源五个核心软件库,显著提升了AI基础设施的效率,特别是在显存优化、通信加速、矩阵运算、并行训练和数据存储方面取得突破性进展。这些成果为大规模AI应用提供了高性能基石,建议关注相关产业链标的。