大模型发展回顾
大模型发展以Transformer架构为基础,Scaling law(规模法则)贯穿始终。早期大语言模型(LLMs)通过自回归架构强化文本生成能力,Transformer架构克服了RNN长文本局限性,标志着NLP的分水岭时刻。Transformer架构包括Encoder/Decoder、注意力层、前馈神经网络层,其中自注意力机制和多头注意力机制提升了模型的表达能力。预训练Transformer模型时代,GPT和BERT模型取得突破性进展,GPT-3以1750亿参数开启了预训练侧Scaling law叙事。Post-training阶段,监督微调(SFT)和基于人类反馈的强化学习(RLHF)等技术被用于解决模型幻觉问题。随着模型规模扩大,训练侧Scaling law瓶颈出现,推理侧接过Scaling law叙事大旗,强调增强推理能力。Transformer架构在长序列场景下计算复杂度较高,Mamba架构集成Transformer+RNN优势,成为Transformer架构的强劲挑战者。
国内大模型进展
国内大模型行业充分竞争,降本提效为主旋律。典型代表包括百度文心一言、智谱清言、讯飞星火、Kimi、可灵、华为盘古、Qwen、元宝、豆包和DeepSeek等。DeepSeek早期确立AI战略,模型家族涵盖标准语言模型/推理模型/多模态模型,DeepSeek-R1性能对标OpenAI o1正式版,实现发布即上线,且具备领先的性价比优势。DeepSeek开源了五大核心技术单元库,包括FlashMLA、DeepEP、DeepGEMM、DualPipe+EPLB和3FS,大幅提升模型推理效率。豆包大模型在实时语音、视频生成/理解领域布局,2024H2发力月活冲上全球第二,新模型豆包pro 1.5依靠稀疏MoE架构实现小参数高性能,MoE杠杆提升至7x。Qwen系列模型掀起国内模型开源革命,新模型Qwen2.5 max实现性能领先,布局推理模型Qwen QwQ,QwQ-32B登顶全球领先开源模型。
海外大模型进展
海外头部大模型依托资源壁垒形成强马太效应,主要竞争者包括OpenAI系GPT模型、Anthropic模型Claude、谷歌自研模型Gemini、Meta自研模型Llama和xAI等。OpenAI以非营利性组织形式创立,GPT1-GPT4迭代实现能力跃升,多模态+推理模型上均实现引领作用,GPT-5即将发布,Agent领域加速布局。Google发布原生多模态模型Gemini 1.0/1.5/2.0,全线产品进入Gemini2.0时代,核心优化多模态能力+智能体构建,加速推动用户(端侧+云端)增长。Meta十年布局跻身全球AI巨头,Llama成为全球开源模型标杆,Llama3.3提升后训练实现低成本高性能,智能体生态加速构建。Antropic发布市场上首个混合推理模型Claude-3.7-sonnet,Claude-3.5对标OpenAI,Agent系列computer use推动人机交互变革。
模型未来研判
未来大模型发展将聚焦于模型架构的演进和算法的优化。MoE(混合专家模型)将与Transformer融合,逐步成为主流架构,DeepSeek提出DeepSeekMoE,在传统MoE架构之上继续降本提效。合成数据作为AI时代新石油,将支撑模型继续在pre training上scaling。DeepSeek带动纯强化学习新范式,引领通向AGI之路,GRPO相对PPO节省了与策略模型规模相当的价值模型,大幅缩减模型训练成本。DeepSeek引领大模型开源且低成本部署潮流,模型普世化趋势逐步明确。