DeepSeek-R1模型的发布标志着大模型格局的重大变化,其核心特点在于卓越的技术性能和显著的成本优势。技术性能方面,DeepSeek-R1采用MIT开源许可证,通过后训练阶段大规模应用强化学习技术,在标注数据极少的情况下显著提升模型推理能力,性能比肩OpenAI GPT-4o正式版,在Chatbot Arena平台上排名第三。成本优势方面,DeepSeek-V3仅用2048颗英伟达H800 GPU完成6710亿参数模型的训练,成本约560万美元,远低于其他顶级模型;DeepSeek-R1的运行成本同样突出,输入费用低至0.55美元/百万tokens(缓存未命中),输出费用为2.19美元/百万tokens,仅为OpenAI GPT-4的三十分之一。开源模式引领行业变革,DeepSeek的开源策略为全球企业和开发者提供了更多自由和灵活性,促进了技术社区的交流与创新,Meta首席AI科学家Yann LeCun表示其成功证明了开源模型正超越闭源模型。突破外部限制方面,DeepSeek-R1的发布让外界重新评估中国的技术发展,美国前高管扎克·卡斯直言美国的限制未能阻止DeepSeek的进步。研究结论认为,AI部署成本和运行成本的降低将带动AI应用与云服务厂商需求增长,建议关注美图公司、汇量科技、第四范式、金山云、万国数据等标的。DeepSeek的低成本主要得益于技术创新(如MLA、MoE算法)、工程优化(如MLA结构、DeepSeekMoESparse结构)和开源策略,其成功复刻在HuggingFace团队和UC伯克利的推动下,进一步验证了开源模型的潜力。