您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [-]:2025年深度行业分析研究报告 - 发现报告

2025年深度行业分析研究报告

信息技术 2025-12-31 - - 张彦男 Tim
报告封面

5 目录 三、海外大模型进展:资源头部集中,压铸AGI 一、大模型发展回顾:以Transformer为基,Scaling law贯穿始终 3.1、海外大模型:格局头部集中马太效应显著,集中押注面向AGI3.2、OpenAI:全球AI大模型风向标,自然语言/多模态/推理模型上均作为引领角色3.3、Google:Gemini面向智能体时代新作,原生多模态领域前瞻布局3.4、Meta:10年布局跻身全球AI巨头,Llama成为全球开源模型标杆3.5、Antropic:Claude-3.5对标OpenAI,Agent系列computer use推动人机交互变革 1.1.1、大语言模型(LLMs)的兴起——自回归架构强化文本生成能力1.1.2、Transformer架构克服RNN长文本局限性,标志着NLP的分水岭时刻1.1.3、Transformer拆解:包括Encoder/Decoder、注意力层、前馈神经网络层1.2.1、预训练Transformer模型时代(2018–2020):GPT VS BERT1.2.2、GPT-3以1750亿参数开启了预训练侧Scaling law叙事1.3.1、Transformer受限于长序列场景,计算复杂度与输入序列表现为指数增长关系1.3.2、Mamba架构集成Transformer+RNN优势,成为Transformer架构的强劲挑战者 四、模型未来研判:投注后训练+算法的持续优化 二、国内大模型进展:行业充分竞争,降本提效为主旋律 4.1、模型架构的演进:从Dense到MoE,模型大幅降本提效4.2、合成数据作为AI时代新石油,支撑模型继续在pre training上scaling4.3、DeepSeek带动纯强化学习新范式,引领通向AGI之路4.4、DeepSeek带动模型加速私有化+低成本部署趋势 2.1、国内大模型:行业充分竞争,降本提效为主旋律2.2、DeepSeek:早期确立AI战略,模型家族涵盖标准语言模型/推理模型/多模态模型2.3、豆包大模型:实时语音、视频生成/理解领域布局,2024H2发力月活冲上全球第二2.4、Qwen:AI为阿里巴巴未来战略核心,Qwen系列掀起国内模型开源革命 一、大模型发展回顾:以Transformer为基,Scaling law贯穿始终 1.1.1、大语言模型(LLMs)的兴起——自回归架构强化文本生成能力 语言模型是一种人工智能系统,旨在处理、理解和生成类似人类的语言。它们从大型数据集中学习模式和结构,使得能够产生连贯且上下文相关的文本,应用于翻译、摘要、聊天机器人和内容生成等领域。大语言模型(LLMs)是语言模型系统的子集。大语言模型规模显著更大,通常包含数十亿个参数(例如,GPT-3拥有1750亿个参数),使得大语言模型在广泛的任务中表现出卓越的性能。大语言模型这一术语在2018至2019年间随着基于Transformer架构的模型出现开始受到关注,在2020年GPT-3发布后,LLMs开始被广泛使用。 大多数LLMs以自回归方式操作,根据前面的文本预测下一个字(或token/sub-word)的概率分布。这种自回归特性使模型能够学习复杂的语言模式和依赖关系,从而善于文本生成。在文本生成任时,LLM通过解码算法确定下一个输出的字,这一过程可以采用的策略包括:1)选择概率最高的下个字;2)从预测的概率分布中随机采样一个字。 1.1.2、Transformer架构克服RNN长文本局限性,标志着NLP的分水岭时刻 2017年谷歌团队提出Transformer模型,Transformer架构也标志着NLP的分水岭时刻。Transformer突破了早期模型如循环神经网络(RNNs)与长短期记忆网络(LSTMs)在捕捉长依赖及顺序处理上的难点,同时RNN和LSTMs计算低效且易受梯度消失等问题困扰。Transformer的横空出世扫清了这些障碍,重塑了该领域格局,并为当代大型语言模型发展铺设了基石。 1.1.3、Transformer拆解:包括Encoder/Decoder、注意力层、前馈神经网络层 1.1.4、Transformer核心点1——自注意力机制(Self-Attention) 注意力机制允许模型在解码时,根据当前生成的词动态地关注输入序列中的不同部分,有效捕捉与输出相关的输入信息,而非依赖于某个固定的上下文向量。注意力机制使得模型更容易捕捉长距离依赖关系,模型在每个时间步都可以选择关注距离较远的输入部分。数学表达上,注意力度量两个向量之间的相似性并返回加权相似性分数,标准的注意力函数接受三个主要输入,即查询、键和值向量。 例如,在电商平台搜索特定商品时,输入内容即为Query,搜索引擎据此匹配Key(涵盖商品种类、颜色、描述等),并通过计算Query与Key的相似度(即权值),得出匹配内容(Value)。 1.1.4、Transformer核心点1——多头注意力机制:运行多个自注意力层,提升模型表达能力 Multi-headed attention(多头注意力机制)增强了自注意能力,扩展关注位置,同时为注意力层提供多个“表示子空间”。假设模型若用了8个注意头,就会有8组不同的Q/K/V矩阵,每个输入的词向量都被投影到8个表示子空间中进行计算。 1.1.5、Transformer核心点2——前馈神经网络: 前馈神经网络是最基本的人工神经网络结构,由多层节点组成,每个节点都与下一层的所有节点相连。前馈神经网络的特点是信息只能单向流动,即从输入层到隐藏层再到输出层,不能反向流动。工作原理上表现为,输入数据首先进入输入层,然后通过权重和偏置传递到隐藏层,隐藏层中的节点对输入进行加权求和,并通过激活函数进行非线性转换,最后输出层接收到经过隐藏层处理的信号,并产生最终的输出。 激活函数:用于在网络中引入非线性,使得网络能够学习和模拟复杂的函数映射。 权重:连接输入层和隐藏层、隐藏层和输出层的连接强度 1.2.1、预训练Transformer模型时代(2018–2020):GPT VS BERT Transformer架构的出现也标志着预训练模型的崛起及对扩展性的重视。BERT与GPT的诞生便显示了大规模预训练与微调范式的成效。 2018年,谷歌推出了BERT模型,模型采用Transformer编码器,在多个NLP任务中取得了突破性进展。与以往仅单向处理文本的模型不同,BERT运用了双向训练方法同时双向捕获上下文信息,以至于BERT在文本分类、命名实体识别及情感分析等语言理解任务中展现出了不俗的表现。OpenAI的GPT系列采用了与BERT差异化的方法,借助自回归预训练来强化生成能力。2018年OpenAI发布GPT的第一个版本,凭借Transformer解码器,GPT模型在自回归语言建模及文本生成领域展现了出色的性能。 单向自回归训练:GPT使用因果语言建模目标进行训练,其中模型仅基于前面的标记预测下一个标记。因此适合于生成任务。下游任务的微调:GPT的一个关键贡献是它能够在不需要特定任务架构的情况下针对特定下游任务进行微调。只需添加一个分类头或修改输入格式,GPT就可以适应诸如情感分析、机器翻译和问答等任务。 MLM(掩码语言建模):BERT不是预测序列中的下一个词,而是被训练预测句子中随机掩码的标记。这迫使模型在进行预测时考虑整个句子的上下文;NSP(下一句预测):模型学习预测两个句子是否在文档中连续,从而理解句子之间关系。 1.2.2、GPT-3以1750亿参数开启了预训练侧Scaling law叙事 2020年OpenAI发布GPT-3(1750亿参数模型),NLP模型迎来了转折点。1750亿参数突破了大规模预训练的界限,展示了显著的少样本和零样本学习能力,在推理时只需提供最少或无需示例即可执行任务。GPT-3的生成能力扩展到了创意写作、编程和复杂推理任务,展示了超大模型的潜力。预训练侧Scaling law的叙事开始出现,模型性能随着模型大小、数据集大小以及训练使用的计算量的增加而平稳提升。在2018年至2020年间,研究人员发现随着模型规模的增长,模型在捕捉复杂模式和泛化到新任务方面变得更好。这种规模效应得到了三个关键因素的支持:1)数据集大小:更大的模型需要庞大的数据集进行预训练;2)计算资源:强大硬件(如GPU和TPU)的可用性以及分布式训练技术,使得高效训练具有数十亿参数的模型成为可能;3)高效架构:混合精度训练和梯度检查点等创新降低了计算成本,使得在合理的时间和预算内进行大规模训练更加实际。 1.2.3、Post-training重要性凸显,RLHF范式出现(2021–2022) GPT-3同时也表现出大型语言模型与人类价值观、偏好及期望保持一致上的挑战。其中,“幻觉”问题尤为突出,即LLM生成的内容可能与事实不符、缺乏意义或与输入提示相悖,给人以“言之凿凿却离题万里”之感。为应对模型幻觉,2021至2022年间,研究人员推动了监督微调(SFT)及基于人类反馈的强化学习(RLHF)等技术的进展。 SFT(有监督学习方法)通过提供明确的输入——输出对,模型学习其中的映射关系。但SFT的弊端包括有1)可扩展性问题:收集人类演示需劳动密集且耗时,尤其是对于复杂或小众任务;2)性能:简单模仿人类行为并不能保证模型会超越人类表现,或在未见过的任务上很好地泛化。RLHF(基于人类反馈的强化学习)解决了SFT中可扩展性和性能限制的问题。RLHF包括两个阶段,首先:1)根据人类偏好数据集训练一个奖励模型,该模型学习根据人类反馈评估输出的质量。2)使用强化学习微调LLM,奖励模型使用近端策略优化(PPO)指导LLM的微调,模型学会了生成更符合人类偏好和期望的输出。 2022年3月,OpenAI发布GPT-3.5,与GPT3架构相同但关键增强包括改进数据更好地遵循指令,减少了幻觉。 1.2.4、训练侧Scaling law瓶颈出现,推理侧接过Scaling law叙事大旗 Scaling Law描述了模型性能随着模型参数、数据量和计算资源增加而提升的幂律关系,但这种提升并非线性,而是呈现出收益递减现象。在模型规模较大时,资源的增加对性能提升的影响变得有限,资源投入与性能提升之间的平衡关系并非单纯“大力出奇迹”。根据Epoch团队的论文《Willwe run out of data? Limits of LLM scaling based on human-generated data》中统计,高质量语言数据存量只剩下约4.6×10^12~1.7×10^13个单词。结合增长率,论文预测高质量文本数据会在2023~2027年间被AI耗尽。 2024年,AI开发开始强调增强推理(Reasoning),从简单的模式识别转向更逻辑化和结构化的思维过程。2024年9月,OpenAI发布o1-preview,据Altman在x上分享的数据,AIME 2024(高水平的数学竞赛)中,o1-preview将模型回答准确率从GPT4o的13.4%提升至56.7%,o1正式版是83.3%。 1.3.1、Transformer受限于长序列场景,计算复杂度与输入序列表现为指数增长关系 长序列场景下Transformer计算复杂度显著提升:自注意力机制的计算复杂度为O(N2,d),其中N代表序列长度,d表示token嵌入的维度,这意味着Transformer模型的计算复杂度会随着输入序列长度(token数量)的增加呈二次方增长,这种高计算复杂度会导致计算资源的大量消耗,对硬件性能提出了极高的要求。 随着基于Transformer架构的模型规模不断扩大,训练和部署成本也随之大幅增加。在计算资源方面,Transformer模型不仅需要大量的计算资源来支撑复杂的运算,还对并行处理能力有着较高的要求。训练成本不仅要涵盖高性能的GPU,还需要大量的存储空间。并且,随着序列长度的增加,其