发布时间:2026-08-30 一、AI总结内容 一、核心要点 1. 大语言模型(LLM)是基于深度学习与海量文本训练的神经网络,核心逻辑是根据输入预测下一个词,主流模型包括OpenAI GPT系列、Anthropic Claude、智谱GLM、KIMI、深度求索(DeepSeek)等 2. 早期序列模型如前馈神经网络(FNN)、循环神经网络(RNN)存在长距依赖建模差、并行计算难等问题,2017年Transformer架构的问世才推动LLM快速发展 3. Transformer架构沿用编码器(Encoder)-解码器(Decoder)结构,摒弃RNN,完全依赖注意力机制,核心组件包括词嵌入(Input Embedding)、位置编码(Positional Encoding)、多头注意力(Multi Head Attention)、前馈网络(Feed Forward),搭配残差连接与层归一化保障训练稳定 二、最新LLM架构迭代与趋势 1. 当前主流开源SOTA LLM均采用解码器仅(Decoder Only)架构,核心优化方向为注意力机制与前馈网络:KIMI K三采用自研的KIMI Delta Attention、门控多头潜在注意力(Gated MLA),3:1的混合排列兼顾记忆质量与全局信息检索2. GLM 5.3 Flash采用线性注意力(Linear Attention)与稀疏注意力(Sparse Attention)混合架构,优化注意力索引缓存成本,降低长上下文计算开销3. 两类模型均采用混合专家(MOE)架构,通过激活少量专家降低计算成本,KIMI K三更引入潜在MOE(Latent MOE)提升大规模参数路由效率,其总参数达2.8T,但单token激活参数仅约104B4. 前沿探索方向包括状态空间模型(如2023年的Mamba),其长序列效率更高但复杂语言建模有局限,目前未替代Transformer,而是出现Transformer与其他架构的混合趋势(如Jamba、英伟达NEMO Transformer Super) 三、风险与关注 1. Transformer仍是当前LLM主流成熟基础架构,混合架构等前沿方案存在局限性,实际落地效果需关注 2. MOE架构虽能控制计算成本,但超大规模参数下的路由效率可能成为瓶颈 3. 注意力机制优化、混合架构落地等方向仍需解决长序列信息遗忘、计算开销高等问题四、会议声明与提示 1. 本次会议仅面向国海证券符合适当性要求的客户及受邀客户,内容不构成投资建议,决策需自行承担风险 二、音频原文(转写) 大家好,欢迎参加国海传媒模型家系列AI大模型三讲。第一讲LLM架构演进,目前所有参会者均处于静音状态。下面开始播报声明。本次电话会议仅供符合国海证券投资者适当性管理要求的客户以及受邀客户使用。 国海证券不会因接收人收到本次会议相关通知或参加本次会议而视其为客户。本次会议内容不构成任何投资建 议。据此做出的任何投资决策,与国海证券、国海证券员工或者关联机构无关。本次会议只是转发国海证券已发布研究报告的部分观点,仅反映国海证券研究人员于发布完整报告当日的判断。 相关内容请以研究所以公开发布报告为准。会议严禁录音或转发,任何人不得对本次会议的任何内容进行发布、复制、编辑、改编、转载、播放、展示或以其他任何方式非法使。用本次会议的部分或者全部内容。否则将承担相应的法律责任。 国海证券就此保留一切法律权利。在任何情况下。国海证券及其员工对使用本次会议信息或内容所引发的任何直接或间接损失概不负责。市场有风险。 投资需谨慎。大家好,欢迎接入国海传媒框架培训二十四讲电话会。本期是AI大模型三讲的第一讲。L M架构眼镜。 本次电报会会分为三个主要的板块。首先,我们会简要介绍LM的定义。然后会按照模型演进的脉络。拆解TRANSFORMER架构以及其中各个环节的作用。 迪清LM架构从何而来?最后第三个板块,我们会介绍transformer之后的sota大模型又产生了哪些架构迭代。并展望未来可能的演化方向。首先,大语言模型是什么? 嗯,LM是一种基于深度学习和海量文本数据训练而成的,能够理解并生成人类语言的庞大神经网络模型。它的运作本质是根据已有的输入内容来预测下一个最可能出现的词,即NEXT TOKEN PREDICTION。比如在下面的这张图片中,我们可以看到LM会根据已经输入的内容,比如DEEP LEARNING IS VERY这段内容,来给出下面一个可能出现的所有的词。词出现的概率,然后选出这些词中出现概率最高的。 比如在这边的案例中展示的是POWERFUL这个词来作为下一步的输出内容。目前主流的大语言模型包括像OPENAI的GPT系列、ANTHROPIC的CLOUD,还有国内的智谱GLM、KIMI、DEEPSEEK等等。在现代的LM出现之前,学术界对于深度学习和神经网络的研究已经进行了很久。但一直直到2017年,transformer架构问世。 LM才得以快速发展。那么之前的架构之所以无法训练出大语言模型,其最主要的原因是。嗯,早期的序列转导模型,比如像FNN和RNN。存在两个比较重要的问题。 首先,他们没有办法高效的建模长距离的依赖关系。嗯。以及他们没有办法在训练时进行大规模的并行计算。下面的两张图表分别介绍的就是FN和RNN的框架。 呃,我们看到左边的这边的F N N,它的全称是叫做前馈神经网络。嗯,这个模型的架构整体是比较简单的。只要通过将输入层的内容经过几个隐藏层之后,就可以直接获得输出。但是前馈神经网络能够接受的输入长度是一个固定长度的向量,也就是这边绿色的呃原点所表示的部分。 嗯,那么当我们实际想要的输入和它能够 接收的输入长度不一致时。就需要进行,比如像平均嗯长距裁剪、 短距补零来调整输入的长度。这就导致前馈神经网络对于不同长度聚集的处理效率是非常之低下的。并且经过这一系列的。 嗯,数据处理之后。F N也会丢失对于词语语序的理解。比如猫追老鼠和老鼠追猫这两个短语,由于它们是由完全相同的词组成的。如果对他们的输入向量进行平均计算,得到的结果。 也会是完全一致的。呃,因此在这种情况下,FN就没有办法捕捉这种。由词语或者是句子语序 来决定的语义差异。而在右边展示的这个RN结构中,则对于这一问题做出了一个调整。 RN的全称是循环神经网络。他在FN的基础上嗯加入了一个机制。嗯,也就是前一个。输出的TOKEN的输出内容。 会被作为输入。重新加入呃,下面后面一步的输入呃,来经过这个hidden layers,重新来进行token的梳理。也就是说,嗯。这样一来,上下文的记忆就能够通过这种方式被保存。 RN就能够按照顺序来逐个处理句子当中产生的内容。嗯,同时RN也因此能够支持不定长度的输入。但二N的问题在于,它的输入和输出的长度必须是一致的,也就是这边的X和Y。必须是一样长度的内容才可以进行映射。 嗯,这就会导致RN在许多使用场景当中的。呃,发展受限,比如说进行呃一些翻译任务的时候,假设每一个词代表一个token。可能会出现需要多个,比如说英文单词才能够翻译一个中文词语的情况。那么此时RN在这种情况下就会产生较大的问题。 为了解决上述的困难。研究者们分别于2014年和2015年提出了encoder结构和。呃,attention注意力机制。encoder decoder结构,它能够实现不等长序列之间的转换,解决了之前提到的RNN的输入和输出序列必须长度一致的问题。 嗯。比如在右边呃左边展示的这张图中,我们可以看到。呃,encoder decoder结构会先有一个encoder编码器。来处理输入的内容。 嗯,然后生成一个涵盖全部输入文本语义信息的上下文向量。也就是这边中间灰色区域的context vector。再将这个向量作为decoder部分解码器的输入。呃,送入下一个环节。 然后再由decoder来生成目标的序列。但是这种架构呢,同样容易出现比较严重的问题。首先 呃,模型在处理长序列时仍然容易。发生呃遗忘的问题。 也就是随着序列变长。越早期输入的信息在传递的过程中就会容易被不断的稀释 嗯,比如在这边的encoder。案例当中。后面出现的单词。 在context sector当中的占比就会更高,而之前出现的单词就会更加容易被遗漏。其次。嗯,他没有办法判断。不同的输入。 对于当前输出的重要程度。呃,或者说他没有办法判断在当前进行这一个token预测的时候,更应该该关注输入当中哪一些token的部分。比如说同样以一个翻译的案例为例。嗯,有两句句子分别是我喜欢苹果果汁和我喜欢苹果手机。 这两句句子当中的苹果的含义很显然是不同的,前者。呃,应该翻译成水果apple。而后者则是一个品牌iPhone。因此,模型想要正确理解这两句句子当中苹果的意思。 嗯,就不能给。所有输入当中的每一个字词。都赋予相同的关注度。而是应该除了苹果这个词本身之外,更加关注。 呃,像果汁或者是手机呃。来呃,来给他们分配比其他部分更加高的关注度。呃,于是attention机制就诞生了。他解决了。 这个长序列。当中 这边呃容易遗忘并且。呃,关没有缺缺乏对于重点信息关注度的问题。在右图当中我们可以看到。 呃,这边的这个attention layer是在encoder和decoder之间呃所加入的。它能够为每一个输入的token来计算一个权重。再对所有输入的表示进行加权求和。得到这一步的专属新的上下文向量context actor。 这样一来,这个解码器的每一步都能够。有选择性的理解上下文。并且生成呃,与就是并并且与生成内容。月相关的这些输入。 就会在输出的过程中得到更多的关注度。嗯,至此就还剩下没有办法在训练时进行大规模并行计算,这个问题还没有得到解决。且之前的一些研究都是相对比较零散的,没有形成非常有。影响力和清晰的结构框架。 一直直到2017年的transformer结构发布。嗯,中间这张图片展示的就是在attention is all you need这篇论文当中所提供的标准transformer架构的示意图。呃,我们可以看到它左右两边分别是encoder和decoder。所以,穿风的架构仍然是沿用了。 呃,我们之前所提到的encoder decoder的结构。但是他彻底抛弃了之前所常用的R N N,而是选择。完全依赖注意力机制。我们可以看到在左边的这个encoder部分当中。 首先这里的input。呃,会先经过一个input embedding的步骤。呃,INPUT EMBEDDING。在这个环节,呃,所有的 所有的文本信息会被转化成词向量。 然后再加入positional encoding。嗯,这一步是为了在扣呃,在token当中。输入某每一个TOKEN所处的位置的编码,用来表示每个TOKEN在序列当中的位置。嗯,在最初始的传送的架构当中。 呃,每一个encoding都有六层的。一个相同的层来堆叠而成。每个层又包含两个子层,分别是。呃,multi head attention多头注意力机制,以及这边的feed forward。 浅窥网络。每一个子层外面都包含有像残差连接和层规异化。前者能够把信息呃绕过子层来直接的传递,缓解深层网络的梯度消失问题。后者能够将每层输出的数值分布拉回稳定的范围,避免。 呃,某一次训练当中,嗯,出现失误,失误导致整个所有的信息都被嗯破坏的。问题。呃,这两者是共同保质保证,在多层的堆叠当中,这个训练保证稳,保持稳定的进行。而在这两个子层当中。 呃,这边的multi head attention。呃,的具体见。结构可以在右边虚线的这个蓝色框中来进行展开。嗯,在这边。 the multi head attention 的multi指的就是多头注意力机制。所谓的多头是指。让模型在同时从多个不同的角度。来计算和关注呃这下生成token的时候所需要进行关注的这个注意力。 有的头可能会关注,比如像