DeepSeek-V3、R1、Janus-Pro是国人通过算法创新实现算力高效利用的典范。
1)成本:DeepSeek-V3显著降低硬件资源需求,模型训练成本约为o1的二十分之一,总训练成本仅为557万美元(2048个H800 GPU集群3.7天);对比Anthropic GPT-4o(约1亿美元)及未来可能高达100-1000亿美元的AI大模型训练成本,DeepSeek-V3展现出显著成本优势。
2)原理:V3通过分布式推理优化,提升MoE模型负载分配效率,提供可扩展性框架;采用RL、辅助损失自由负载均衡、多Token预测(MTP)、FP8+BF16+FP32混合等方式大幅降低算力消耗。
3)性能:V3为较强开源基础模型,性能媲美GPT-4o及Claude-3.5-Sonnet;671B参数MoE模型超越Qwen2.5-72B、Llama-3.1-405B等,代码能力领先(Codeforces远超非o1模型,SWE-Bench接近Claude-3.5-Sonnet-1022)。
4)开源API收费:DeepSeek-R1性能对标o1,完全开源,API定价极低(输入1元/百万tokens,输出16元/百万tokens);对比GPT-o1-2024-12-17(输入15美元/百万tokens,输出60元/百万tokens),DeepSeek-R1成本优势显著。
5)最新模型支持多模态:Janus-Pro支持读图(SigLIP-L)与生图(LlamaGen),分1.5B和7B版本;训练成本仅为128颗A100训练1周;算法设计借鉴CoT推理,效果超越TokenFlow、Meta Morph等模型,MMBench得分79.2,GenEval得分0.80优于DALL-E 3和Stable Diffusion 3 Medium。
核心观点与结论:
DeepSeek系列开源模型将加速AI应用和Agent爆发(降低调用成本,实现ROI平衡,推动应用井喷)、加速AI终端升级进程(R1支持蒸馏实现端侧模型批量升级)、加速推理算力需求释放(tokens成本降低可能激增总体消耗,推理算力长逻辑强化)。
建议关注:
- AI应用与Agent:美股-CRM、Snow、PLTR、Applovin;A股-泛微网络、致远互联等。
- AI终端升级:美股-APPL、Tsla;A股-世运电路、乐鑫科技等。
- 推理算力:美股-NVDA、AVGO;A股-华丰科技、海光信息等。
风险提示:上游供应、AI产业落地、中游竞争、国际局势、宏观利率风险。