DeepSeek开源大模型发布,引发AI领域重大变革。
核心观点
- DeepSeek开源大模型(DeepSeek-R1/DeepSeek-R1-zero)性能优异,训练成本大幅降低,引发投资者对杰文斯效应的讨论。
- DeepSeek在算法架构、预训练、后训练和蒸馏提炼阶段均有实质创新,结合硬件、算法和系统优化,或对英伟达CUDA的竞争壁垒构成挑战。
- 高效开源AI模型降低模型训练门槛和成本,利好国产半导体产业链,包括算力芯片、晶圆代工和半导体设备等。
关键数据
- DeepSeek-V3训练仅用280万小时英伟达H800 GPU算力,成本约560万美元,相较海外大模型动辄上亿美元的训练费用,成本降低1-2个数量级。
- DeepSeek-R1衍生较小模型性能与海外领先模型(如OpenAI-o1-1217)相似或更好。
行业影响
- 海外芯片:高效开源AI模型降低训练成本,或使下游对高端GPU加速器需求更加理性;推理需求上升,利好不同芯片厂商竞争。
- 英伟达:高端芯片训练需求可持续性受影响,但基础模型开发仍需大量GPU加速芯片。
- AMD:长期影响中性,推理芯片市场扩大或有机会获得更多份额。
- 博通和迈威尔:ASIC厂商或受益于不同算法的ASIC IP设计订单,但单个芯片单价可能下降。
- 国产半导体产业链:利好国产算力芯片、晶圆代工(如中芯国际、华虹半导体)和半导体设备(如北方华创、中微公司)。
- 端侧AI:大模型门槛降低加速生成式AI在端侧部署,利好端侧芯片和设备OEM,如智能手机、个人电脑等。
- 国产智能手机OEM较海外厂商在中文模型上更具优势。
- 机器人相关标的(如地平线机器人、优必选)或受益。
- 云服务商:需进一步观察资本投入回报。
- 以闭源模型为主的CSP(如微软、Meta)模型IP优势变小,护城河或不再明显。
- 开源模型驱动的CSP(如Google、AWS)云业务或加速增长。
海外科技企业反馈
- 微软:DeepSeek创新属实,降低推理成本将推动更多AI应用。
- Meta Platforms:DeepSeek出现表明AI领域将有一个开源标准。
- 英特尔:积极切入开源赛道,优化DeepSeek模型部署。
- 苹果:DeepSeek是推动效率提升的重大创新,将继续采用混合AI战略。
- Palantir Technologies:DeepSeek-R1发布表明开源和闭源模型性能将趋于一致。
研究结论
- 高效开源AI模型崛起,长期利好端侧芯片及端侧AI应用,软件和AI服务提供者直接受益。
- 国产半导体产业链长期利好,国产替代进程加速。
- 云服务商需关注资本投入回报,开源策略或加速云业务增长。