DeepSeek公司及发展历程
DeepSeek公司由幻方量化创始人梁文锋主导创立,依托幻方投资的资金和“萤火超算”万卡级算力资源,致力于AGI技术探索。公司发展历程分为五个阶段:代码模型首秀(DeepSeekCoder、DeepSeekLLM67B)、MoE架构创新(DeepSeekMoE、DeepSeek-V2)、多领域拓展与性能跃升(DeepSeekCoderV2、DeepSeek-Prover-V1.5)、通用模型迭代(DeepSeek-V3、DeepSeek-VL2)、推理模型发布(DeepSeek-R1-Zero、DeepSeek-R1)。DeepSeek-R1发布后,在媒体和资本市场引发震动,成为资本市场的宠儿,并接入云服务、网络安全、办公&教育、政务、医疗等多个领域的国内外知名企业。
DeepSeek的技术创新
DeepSeek的技术创新主要体现在MoE架构和MLA机制上。DeepSeekMoE通过降低激活参数比例,实现训练效率3.6倍提升和训练吞吐量3.6倍提升。DeepSeek-V2通过引入MLA机制,节省42.5%的训练成本、减少93.3%的KV缓存,并将最大生成吞吐量提升至5.76倍。此外,DeepSeek还利用多个token预测技术、动态FP8混合精度和GPU底层部署优化等技术,进一步提升模型性能和效率。
DeepSeek-V3的实际开发成本
DeepSeek-V3的官方宣称训练成本为558万美元,但实际总成本预计超过4000万美元,包括前期研发投入约2000-3000万美元、数据成本、硬件折旧成本和实验试错成本约500万美元。相对于Llama3-405B降低了约69%,相对于GPT-4o降低了95%。
GPU算力需求分析
短期内,由于AI巨头公司在大模型领域的“军备竞赛”,算力支出金额的增长仍然难以看到放缓的趋势。但从长远来看,随着人类生成的公共文本数据在2028年左右耗尽,数据资源将成为模型进化的重要瓶颈,算力需求主要来自于细分领域的推理需求,而非持续的线性或指数级增长。
DeepSeek对产业发展的影响
DeepSeek的横空出世,推动了AI应用加速落地。预计接入DeepSeekAPI的细分领域推理服务商将会快速涌现,同时具备足够算力的终端设备将会能够实现蒸馏小模型的本地部署能力,包括服务器、智能手机和智能驾驶系统都将会迎来新一轮的升级浪潮。看好先进算力芯片制造产业链、专业咨询服务、2C智能终端和2B本地部署设备等细分板块在DeepSeek推动下的未来发展。
风险提示
大模型开发进度缓慢,模型升级不及预期;AI行业应用落地迟缓,商业模式难以实现良性循环;贸易摩擦加剧,先进芯片及半导体技术受限。