您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 未知机构:《国海传媒AI大模型三讲第二讲:LLM如何训练》-发现报告

国海传媒AI大模型三讲第二讲:LLM如何训练

2026-09-01 未知机构 SoftGreen
报告封面

发布时间:2026-09-01 一、AI总结内容 一、核心要点 1. LLM训练包含AI数据工程、预训练、中训练、后训练四大核心环节,后训练涵盖监督微调(SFT)、偏好学习与强化学习(RL),强化学习有PPO、GRPO等算法2. 大语言模型(LLM)与传统单任务机器学习的核心区别在于采用预训练加后训练的两阶段框架,具备通用能力与跨任务泛化潜力3. 模型能力增长遵循Scaling Law,核心依赖参数量、数据量、算力三个维度协同扩大,当前行业已拓展至数据环境、推理计算等方向 二、关键技术细节 1. 预训练核心为next token prediction,通过损失函数计算预测误差,经反向传播更新模型参数,基座模型(Foundation Model)由此形成2. 中训练是预训练到后训练的中间优化阶段,采用自监督语言建模,核心是调整数据配比与学习率,如清华团队提出的decay阶段策略3. 监督微调(SFT)依赖高质量指令数据与示范答案,但存在数据质量瓶颈与灾难性遗忘问题;偏好学习先训练奖励模型,再通过PPO等算法引导模型优化4. GRPO是PPO的改进算法,无需单独训练价值模型,通过组内答案相对奖励评估,降低强化学习成本,适配大规模推理模型训练三、模型能力演进方向 1. 知识蒸馏是让小参数学生模型学习大参数教师模型的输出概率分布,在低部署成本下逼近大模型能力,近年衍生出OPD在线策略蒸馏技术 2. 递归式自我改进(RSI)是AI自主参与模型研发全流程,目前已进入实践阶段,如智谱拟推出全自主训练模型,Anthropic、OpenAI等海外厂商也在推进相关布局四、风险与关注 1. 单纯扩大模型规模面临公开高质量数据减少、成本快速提升的瓶颈,Scaling Law的边际收益可能下降2. 全自主训练的核心挑战是模型需自主判断与控制训练全流程,如修正错误、调整数据策略等3. RSI将带来研发效率复利,可能扩大头部模型厂商与其他参与者的差距 二、音频原文(转写) oh 大家好,欢迎参加国海传媒模型系列AI大模型三讲。第二讲LLM如何训练。目前所有参会者均处于静音状态。下面开始播报声明。 本次电话会议仅供符合国海证券投资者适当性管理要求的客户以及受邀客户使用。国海证券不会因接收人收到本次会议相关通知或参加本次会议而视其为客户。本次会议内容不构成任何投资建议。据此做出的任何投资决策。 与国海证券、国海证券员工或者关联机构无关。本次会议只是转发国海证券已发布研究报告的部分观点,仅反 映国海证券研究人员于发布完整报告当日的判断。相关内容请以研究所已公开发布公告为准。会议严禁录音或转发,任何人不得对本次会议的任何内容进行发布、复制、编辑、改编、转载、播放、展示或以其他任何方式非法使用本次会议的部分或者全部内容。 中。否则将承担相应的法律责任。国海证券就此保留一切法律权利,在任何情况下。国海证券及其员工对使用本次会议信息或内容所引发的任何直接或间接损失概不负责。 市场有风险。投资需谨慎。大家好,欢迎接入股海传媒框架培训二十四讲电话会。本期是AI大模型三讲的第二讲,LM如何训练。 本场电话会会分为三个板块。第一部分是对于LM模型训练流程的详细拆解。从AI的数据工程预训练、中训练到后训练。系统性的介绍大模型,呃,如何从数据中学习并逐步形成能力。 第二部分是对于大模型能力增长规律的分析,会围绕scaling law介绍模型的规模数据算力。呃,以及推理计算等等多维度扩展。如何能够推动模型能力的提升?第三部分是呃,模型能力的增强与未来演进的方向,会重点讨论蒸馏、O P D以及递归式自我改进,也就是R S I技术。 呃,如何进一步提升模型的效率和推行AI的自主优化?嗯,首先模型训练的本质,它其实是一个机器学习的过程,也就是通过数据来训练模型,呃,让模型从数据中学习规律,并且进一步的完成预测生成等等的任务。嗯,传统的机器学习通常是一个单阶段的训练流程,它是针对于特定的任务来准备训练数据,并且呃,形成一个专用的模型。因此,这种传统机器学习会存在一个比较大的局限。 首先,嗯,它所训练的出来的模型是单 一任务导向的,比如说呃一个模型只能进行图像的识别分类,呃,然后另一个模型可能只能用来识别垃圾邮件等等。嗯,其次,嗯,这种类型下的模型的泛化能力会比较有限。一个模型学习到的任务规律很难直接迁移到其他的领域,比如说。一个用于识别图片的模型。 他就并不能直接理解文本生成内容,或者说呃完成其他的复杂的推理任务。相比之下,大语言模型通常采用预训练加上后训练两个阶段嗯结合的形式来训练模型。第一阶段当中的预训练,也就是语言建模阶段。在预训练的当中。 模型会在海量的无标注文本数据上进行训练。通过预测下一个token。来学习人类语言的规律和知识。最终形成具备通用能力的基础模型,也就是这里的基座LM。 英文通常称之为foundation model或者base model。嗯,第二个阶段也就是后训练。在这里会进行模型的微调。基于预训练得到的这个基座模型,使用更加高质量、有监督的数据进行下一步的优化。 嗯,这里的目的是让模型能够 理解人类的指令,并且更加符合实际使用当中的需求。这两个阶段是大圆模型训练最基础的框架。并且随着呃模型的不断扩大。实际工程当中又进一步发展出了数据处理。 中训练强化学习、蒸馏等等更多的训练环节。嗯,接下来我们会按照训练的流程展开,具体看一下。呃,每个阶段使用了什么样的数据?以及模型是如何一步步学习和优化的。 在进入具体的训练阶段之前,首先要介绍一个贯穿大模型训练流程的环节,也就是AI的数据工程。大模型的能力本质上来自于它的训练数据。因此,在训练开始之前,我们需要围绕呃模型的训练目标,针对其数据进行系统化的处理。具体的操作包括。 呃,对于数据的获取、获取清洗、筛选、合成、标注。以及配比等等。呃,并且对于不同的训练阶段,数据工程所关注的重点也会不同。在预训练阶段,嗯,主要的目标是让模型学习通用知识和语言规律,因此。 在这个阶段需要构建的是。大规模多样化的文本数据集 包括呃网页、书籍、代码等等的数据。在后训练阶段,模型的训练目标就从学习通用的知识转向了优化模型的行为。因此,在这个阶段需要准备 高质量的指令数据、偏好数据以及 人工的反馈数据等等。 在强化学习和模型的评测阶段,则需要构建奖励信号。交互轨迹以及呃评测的数据。用于衡量和提升模型在推理工具调用等等复杂任务上的表现。在完成了数据处理之后,就进入了大语言模型训练的第一阶段,也就是预训练。 呃,预训练的核心任务 是进行next token prediction。比如说,呃,输入一句话之后,模型需要根据前面的文本内容预测出。下一个最可能出现的TOKEN。在模型完成预测之后,会将预测的结果和输入给它的真实答案进行比较。 并且通过一个损失函数loss function。计算预测结果和真实答案之间的差距。嗯,如果预测结果错误,模型就会通过反向传播这个机制来计算。每一个参数。 对于预测误差的影响,也就是计算梯度。嗯,最后会有一个优化器,根据梯度的方向来更新模型的参数,使得下一次的预测更加准确。在上一讲大圆模型的模型架构当中,我们介绍了transformer当中的attention权重。query key value 以及大量的参数矩阵。 这些参数就是在呃如右下角呃左下角所示的这个原理当中。按照这一个预测计算误差更新参数的循环。不断的进行调整和优化的对象。在呃训练最开始的时候,所有的模型参数通常是随机的一个初始化的参数。 而随着TOKEN数据不断被输呃不断被输入,以及模型不断重复这样的一系列的循环,最终会形成一个嗯具备通用能力的基础模型。在完成了预训练之后,通常还会存在一个中训练的阶段。嗯,中训练并不是像预训练和后训练一样有明确定义和统一的标准的训练阶段,而更多的是业界对于呃预训练之后、后训练之前这个中间优化过程的统称。由于中训练本质上仍然是使用呃自监督语言建模,因此它的训练流程和预训练是基本一致的。 主要区别就是在于训练数据和训练目标的。侧重不同。在实际的模型开发当中,中训练已经成为了越来越常见的一个工程实践的步骤。例如在很多的国产大模型的技术报告里,都能看到很明确的对于中训练阶段的划分。 比如在左上角这里的。G O M无呃的技术报告当中可以看到,在模型训练的pipeline当中。呃,在base model训练的过程中,pre training之后有进进入一个叫做mid training的阶段。而在右上角这边的MINI MAX M一和M二的技术报告当中也提到了。 呃,continue pre training和decay face等等的训练策略。这里的deca face最早是由清华大学团队于二零二四年的论文当中提出。他们将训练的过程按照学习率变化分成了三个阶段。在warm up阶段,训练的初期会逐渐的提高模型的学习率,使得 模型的参数进入一个训练的状态。 呃,第二个是stable的阶段。随着这个warm up阶段的结束,模型来到了一个比较高的学习率,并且持续的保持。在这一阶段,模型能够从大规模的数据上充分学习语言规律和知识。嗯,最后第三个就来到了decade阶段。 在这里呃,学习率会逐渐降低,使模型稳定和收敛。在这个阶段当中,由于模型已经学习了大量的通用知识。所以继续使用完全相同的大规模数据。能带来的收益会逐步降低。 因此,在工程上会 呃,同步的调整数据的配比。引入更多的高质量数据,例如代码、数学或者是其他的呃垂类的知识等等。来进一步的提高模型的能力。在完成了预训练和中训练之后,模型已经具备了一定的语言理解和知识能力。 但它本质上仍然只是一个预测的基础模型,并不能够按照人类的需求来进行交互和执行任务。因此,下一个阶段后训练。嗯,主要就是针。添加针对性的数据,来进一步的优化模型行为的这样的一个过程。 它的整体的目标就是为了让模型能够更加符合人类的使用习惯,呃,能够理解指令、遵循要求,并且输出更加有帮助、更加安全和符合人类真实的需求,或者说偏好的一些回答。目前一个比较标准的后训练主要包含两个阶段:第一步是监督微调过程,就是supervised fine tuning SFT,它能够让模型学习人类希望它如何回答问题。嗯,第二个步骤就是 偏好优化和强化学习reinforcementlearning会进一步让模型学会区分什么样的回答是质量更高的,并且让它在呃自己实际进行推理输出的过程中来产出这样子更加符合偏好的高质量回答。 这个图片展示的就是openai在2022年发布的instructgpt论文,嗯,它就是展示了gpt三基础模型到instructgpt之后完整的后训练流程。首先来看监督微调。监督微调是指在基础模型的基础上,继续使用高质量的指令数据和示范回答来进行训练。使模型能够理解用户的意图,并且。 呃,按照要求来完成任务。首先,人类会根据嗯提前设定好的问题来写出符合预期的参考答案。呃,随后模型会基于这些数据。呃,继续进行next。 token prediction的过程 将自身生成的结果与人类提供的标准答案进行一个对比。并且通过计算loss不断的来调整模型的参数。是呃,模型输出的答案逐渐接近人类示范的这个范本表达的答案。因此,SFT它本质上仍然是一个呃监督学习的过程,也就是输入用户的指令。 呃。目标 是人类示范的回答,然后模型学习的是如何按照人类的期望来完成这个任务。但是从这个流程就可以看到,S F T它的效果是高度依赖于示范数据的质量和覆盖范围的。如果数据的质量不足,那么模型可能无法正学习到正确的行为。 呃,如果覆盖的范围比较的有限,那么模型面对新的场景时,它的泛化能力就会受到限制。嗯,此外,过度的微调也可能导致模型出现灾难性遗忘的问题,也就是模型在学习新任务的过程中损失率训练阶段获得的部分的通。能力。但是仅仅通过呃SFT模型,只能够学习人类示范的标答是什么样的。 但在现实生活中的问题,往往不存在唯一的标准答案。比如说嗯,写一篇商业分析