大语言模型发展路线图
生成式AI自2014年以来经历了快速发展,关键技术包括Attention、Transformer、Scaling Laws、RLHF和o1/R1等,经历了多次AI寒冬和复兴周期。
自然语言处理与语言模型
自然语言处理旨在使计算机具备人类语言能力,语言模型则是通过统计方法预测句子中的下一个单词。大语言模型自2018年以来快速发展,涉及算力管理、数据处理、通用模型和行业模型等多个方面。
大语言模型:生命周期与范式
大语言模型的生命周期包括数据处理、预训练、后训练和应用部署等阶段。后训练范式成本较低,推理语言模型成为研究热点。扩展法则是大语言模型性能提升的关键。
DeepSeek:技术创新
DeepSeekV2-V3/R1在模型架构上进行了多项创新,包括DeepSeekMoE、MLA、Infrastructures和Multi-TokenPrediction等,显著降低了训练和推理成本。DeepSeekR1通过大规模强化学习训练,发现了RL训练的Scaling Laws,并提出了推理模型训练技术框架和强化学习训练框架,实现了推理能力蒸馏。
DeepSeek:效应
DeepSeek的开源发布推动了算力价格战,打破了美国AI第一梯队企业的技术护城河。DeepSeek的成功也改变了美国对中国AI水平的认知,并降低了大模型研发成本的认知。
DeepSeek:创新&人才&Vision
DeepSeek的成功得益于技术型人才的锐意创新和战略型人才的远见卓识。DeepSeekV3和R1的创新属于探明技术方向上的0-1创新,为AGI发展提供了重要参考。
未来展望
未来AGI/ASI可能还需要3-5个重大突破。DeepSeekR2可能很快发布,未来将聚焦于更多领域RL训练。AI reasoning+research将成为科研人员的重要机会。推理+安全将是未来需要突破的方向。