DeepSeek,成立于2023年7月,是一家专注于开发先进大语言模型(LLM)及相关技术的创新型科技公司。公司背靠幻方量化,创始人梁文锋同时也是幻方量化创始人。DeepSeek致力于通过技术创新降低大模型训练成本,提升推理速度和效率。
DeepSeek模型家族:
- DeepSeek-LLM (2024年1月): 第一版大模型,使用传统Transformer架构,已体现出成本节约和效率提升的思想。
- DeepSeek-v2 (2024年5月): 采用混合专家(MoE)架构,训练成本降低42.5%,推理速度提升。
- DeepSeek-v3 (2024年11月): 进一步优化MoE架构,性能大幅提升,训练成本大幅降低,在开源模型中表现优异。
- DeepSeek-R1 (2025年1月): 基于DeepSeek-v3训练优化,增强复杂逻辑推理能力,性能对标OpenAI-o1正式版,开源模型权重引发全球关注。
DeepSeek技术创新:
- DeepSeekMoE架构: 细粒度专家划分和共享专家隔离,提升模型灵活性和表达能力。
- 多头潜在注意力(MLA): 减少KV缓存大小,降低推理成本,提升推理效率。
- 开源策略: DeepSeek-v3和R1模型采用MIT协议开源,降低大模型准入门槛,促进开源生态发展。
- 纯强化学习训练: DeepSeek-R1应用大规模强化学习,直接将RL应用于基础模型,开发出DeepSeek-R1-Zero,展示了自我验证、反思和生成长COTs等功能。
- 冷启动数据&多阶段训练策略: 提升模型可读性和性能,并通过蒸馏技术将推理能力迁移到更小的模型中。
DeepSeek商业模式:
- API接口: 按Token计费模式,提供高性价比的API调用服务。
- 本地化部署: 为企业提供稳定、灵活、数据安全的本地化部署方案。
DeepSeek应用场景:
- 能源领域: 多家能源企业完成DeepSeek大模型私有化部署,提升能源业务运营效率。
- 电信领域: 中国电信、中国移动、中国联通三大运营商全面接入DeepSeek,提升网络管理效率和客户服务质量。
- 金融领域: 多家金融机构接入或部署DeepSeek,提升技术实力和市场竞争力。
- 政务领域: 多地政府将DeepSeek应用于政务系统,提升办公效率,拓展应用场景。
AI大模型市场现状:
- 发展历程: 经历萌芽期、探索沉淀期和迅猛发展期,2024年中国AI大模型商业发展加速。
- 市场现状: 语言大模型为市场主流,AI大模型应用规模不断壮大,价格下降趋势仍在继续。
- 市场格局: 云侧大模型和端侧大模型并存,本地化部署和云部署成为主要部署方式。
- 商业模式: 本地化部署、云部署、API及SaaS、PaaS、Maas等方式并存。
Deepseek对AI行业影响:
- 对AI模型层: 开源与价格优势将导大模型层竞争加剧,打破已有过度依赖算力与标注数据的局面,促进开源生态发展。
- 对AI算力层: 短期内降低对先进算力需求预期,为国产显卡和ASIC芯片带来机会。
- 对云厂商: 利好云厂商下游需求增长,有望进一步提升国产云厂商利润率。
- 对AI应用层: 降低AI应用研发与落地的成本,加速AI应用发展,推动AI端侧落地。
研究结论:
DeepSeek通过技术创新和开源策略,在AI大模型领域取得了显著成果,对AI模型层、算力层、云厂商和应用层都产生了深远影响,推动AI行业朝着更加开放、普惠的方向发展。