您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 未知机构:《申万传媒:大语言模型及商业化、悦己消费出海AI产业链》-发现报告

申万传媒:大语言模型及商业化、悦己消费出海AI产业链

2026-08-27 未知机构 故人
报告封面

一、AI总结内容 一、核心要点 1. 大语言模型技术路线当前以Transformer架构为核心,推理过程包含分词、词嵌入、位置编码、Transformer块处理及下一个token预测,训练分为预训练和后训练,2025年后技术优化方向含MOE、稀疏注意力、KV缓存精度升级及后训练效率提升。 2. 模型定价与成本方面,GPT降价源于硬件适配及投机解码优化,DeepSeek成本优势来自架构、算力利用率及硬件适配,当前模型分层定价趋势明确,轻量级任务靠性价比竞争,高端模型聚焦coding、科研等高价值场景。 3. API收入结构随技术发展变化,2025-2026年coding、agent阶段输入token占比超80%,整体mix price呈下行趋势,同时高价值场景存在头部红利及优质用户高粘性。 4. AI商用空间方面,AI办公是可见度较高的第二增长曲线,测算办公运营场景稳态市场规模约6000亿,高于coding场景的约4000亿,还存在医疗、法律等细分潜力场景。 二、风险与关注 1. 大语言模型技术存在算力消耗压力,厂商需通过设置动态思考预算控制成本。2. 大模型公司面临重段用户占比过高导致付费项目盈利性不及API的问题。3. 云厂受益于开源模型趋势的逻辑存不确定性,云厂自身需承担训练投入,且模型厂设置的开源授权分成可能影响云厂收益空间。 三、后续关注 1. AI办公场景的落地进展及付费转化情况。2. 大语言模型技术迭代对推理效率及成本的优化成果。3. 悦己消费出海相关产业链的动态情况。 二、音频原文(转写) 大家好,欢迎参加申万传媒大语言模型及商业化月季消费出海和AI产业链十二讲。目前所有参会者均处于静音状态。下面开始播报声明,请参会人员务必注意本次电话会议交流内容仅限参会人员内部参考。任何机构或个人不得以任何形式对电话会议任何内容进行泄露或外发,请勿以任何方式索要。 泄露、散布、转发电话会议纪要、任何泄露电话会议纪要等信息的行为均为侵权行为。申万宏源研究保留追究泄露转发者法律责任的权利。各位投资人,大家晚上好,我是申万传媒的互联网分析师梦妮啊。今天跟我一起做这个大语言模型的分享的这个还有我们的同事王浩啊。 那大语言模型其实是从去年开始到现在,大家持续关注度都很高。那特别是像minmax昨天还发了这个它的这个中期。的一个业绩也是八月的A R非常超预期。好,那大家也会非常关注,就是一个行业竞争格局的变化,还有一个就是行业的需求空间到底应该怎么去看待。 那今天我们的这个材料里面都会跟大家详细的去讨论这些方面的事情。呃,首先的话,我们从一个 比较简单 的方向开始。就是大家常常谈到了这个transformer架构。它到底是一个什么样的架构? 我们为什么去讨论这个问题呢?其实是因为 目前啊,大语言模型的这个技术路线还是收敛到transformer架构上的。那这个架构本身是2017年的时候,这个论文提出来的,它有这个编码器和解码器两部分。但是现在因为解码器已经能够学到,就是整个。 呃,世界世界内容的这个世界分布的大部分内容,所以。呃,编码器这一部分就是去看全局信息的这部分,反而变得没有那么重要。是呀。呃,整个推理过程呢,是是从这个输入问题开始。 也就是我们正常去跟模型进行对话的时候。我们可以看到。首先我们去输入一个问题,然后用这个分词器去进行文本切分。那可能英文里面它的写分方式比较简单,它是以空格去做分词的。 那中文中呢,就可能大家会是E。to 呃,一些词的停顿啊等等这样的方式去做这个词的切分。做完词的切分之后,我们需要去把文字变成数字。那这个过程也叫做词嵌入,英文就叫做embedding。 我们把它去跟一个词表,一个非常庞大,参数量很大的这样的一个词表去一一对应起来。去确定每个词在整个的空间中,它的位置到底在哪里。然后我们会把这一句话里面所有词去进行一个位置编码。是。 已确定,因为 呃,词单词它是不包括,就是它在整个语序中的信息的。所以为了确认语序中的信息,我们会把词做一个位置编码,然后放到。transformer架构里面最主流的这个transformerblock里面,那么它是有非常多层这种block的,那核心就主要是分分为两个。一个是这个attention,就是关注。 你这个词和前后上下文的这个关系,那么它是通过K V矩阵。啊,就Q K V这几个方式去判断你当前这个词。跟这整个语句中,它到底是一个什么样的关系?你和谁的关系更近,和谁的关系更远? 再往下去传呢,就到了这个F F N这一层前馈神经网络。那这一层是通过线升维再降维的一个方式。啊,去让用户 呃,让让这个大模型理解啊,当前这个词它的丰富的语义信息。我们在携带着这个,一个是上下文关系,一个是更丰富的语音信息往下去传推测。 再向下一个词。最大概率有可能是什么?比如。呃,经常举的一个例子是,像中国的首都是北京。 那北京如果是下一个预测的token,我们可能是中国首都。那这几个词是什么关系?中国的首都是,那是在这里面表达什么关系?是的,下一个词更有可能是什么? 啊,所以这个整个就是推理的前项过程。嗯。直到你预测出来,下一个token是北京。啊,我们把这个北京里的对应的数字变成汉字,那么就是你预测下一个投票的结果。 然后呢?え。因为之前已经计算过中国的首都,它所有的Q K V矩阵。所以我们在进行下一轮前向传播的时候,不需要重新计算它的Q K V。 我们只需要去。呃,调用我们之前已经算过的这个k矩阵、v矩阵的这个。缓存值就可以,所以这也是K V缓存的一个意义啊,就是 我们计算的大量的这个参数矩阵,它的值到底是多少?我们其实给它存起来。 啊,然后这是整个推理过程。那么训练过程呢,又分为预训练和后训练这两部分。预训练的我们是 啊,通过把一个长的文章放进这个模型里面去,我们进行一个。掩码,然后把这个让它去生成这个我们遮掩住的这一部分。 啊,然后用他的答案和我们实际的正确答案去比较,然后通过一个损失函数去降低这个损失函数的误差。直至误差降为零为止。啊,那得到的这样的一个参数序列,我们把它一层一层向前传去确认。我们整个的这样的一个参数,最后的一个结果,这是预训预训练。 它跟前面的这个推理过程正好是一个反向的过程,那后训练呢?又是另外一面一把事情,后训练可能有非常多的。方向一方面就可能做一些监督微调,然后另外呢就是去做这个偏好对齐。偏好对齐里面我们会涉及到奖励模型。 嗯,比如说我们有一个目标模型,可能有奖励模型,我们怎么样去让我们的现在的目标靠近我们想奖励的一个结果。啊,等等,通过非常多的函数去 实现这样的一个,就是 让我们的模型呃做到我们想要的这样的一个结果。那么在这个使实际使用的过程当中,还会有非常多的像安全。ah. 合规等等的一些方向的东西,也包括就是一些特定领域的特定内容。 比如金融、法律等等。那我们又可以在这个基础上进行一些微调。所以当前呢,我们去判断就是整个的。transformer架构其实没有发生太大的改变啊。 那他可核心改变呢,还是说?这个 嗯,数据量,然后包括后训练,还有推理系统的一些部署的情况。我们去复盘大模型的技术路线变化,可能更多的变化是在2025年之后。那么随着参数量的不断扩大,整个预训练的方向呢会 分为两个方向,就是预训练里面可能着重优化有两个方向。 第一个是MOE,第二个是SPARSE ATTENTION。呃,M O E就是我们在刚刚这里面就乾坤神经网络F F N这一层里面我们去。由不同的专家。去就是设置不同的Router,去激活不同的这个专家。 那每个专家可能负责的 方向不一样。所以我们是通过扩大总参数,但不同。不等比例去扩大单头客的一个计算量的方式。嗯,去去去提升模型的这样的一个智能水水平。 Sparse attention呢是在attention注意力机制里面,就是每个生成tok每个token生成的时候呢。你不去看前面所有的上下文,你可能只看跟你相关的上下文。那这个一个是。呃,一个是能够降低它的计算量,提升它推理效率。 还有一个就是如果你选的对的话。可能你受到其他文,其他不相关上下文的干扰会变得更少。其实模型的智能水平也可能是。虽然没有下降,甚至是提升的。 嗯,那还有一个在于训练里面比较重要的就是KV缓存和芯片特性。就我们可能原来存的次数,存的数量比较多。就比如说原原来可能存F P十八,呃,F P十六,F P八。那现在可能KIMI也好,DPC也好,大家都是FP六和FP八和FP四。 嗯,这样的一些就是降低它这个数字的精度,但是并没有影响模型的智能水平。呃,后训练的话,今年一个是大家的数据。质量提升的比较快,另外也是。后训练今年大家集中在口定方向,包括口呃这个数学方向。 那可验证的一个结果,能够让模型去实现一个自我迭代。也对,所以这样的一个情况下,我们的整个后训练的效率有一个明显的提升。那推理这个阶段呢,总共就是两个方向,一个是你问的问题非常的简单的时候。你去降低它整个token的这个成本,然后提升它吞吐,降低延迟。 呃,如果是复杂问题,比如说多轮次的对话呀,agent这样超超长上下文的问题的话。那我们去要去提升复杂任务的正确率啊,对,然后提升简单任务的这个速度。对,所以这是目前的一些。呃,技术路线的一些变化。 嗯,那从这个模型的方向上来讲,我们分为预训练、后训练啊,还有推理啊。预训练其实它主要是。学习呃世界的分布 嗯,学习这个主流模型,目前去训练的本质都是去预测下一个token,也就是在最大算然估计的一个解。基础上去。 这个呃更好的去预测它的这个下一个概率最大的词是什么?啊,那我们认为他遵循一个scaling law啊,就是 你训练的这个参数量越大,你模型可能能够更准确的预测下一个词是什么。我们觉得基于整个transformer架构的预训练,其实没有什么数学分歧。你更多的分歧是在嗯,比如说你工程的能力上,你数据本身的质量上,然后嗯,你数据可能为了多少,然后包括你问的这么多数据,你的呃算力,你的算力能否支撑你去训练这么多的数据,以及你是否充分训练了你这些数据,然后包括模型的结构啊,模态的扩展等等。 所以嗯,当前的这个模型大家可能还是能够看到,就是我觉得主流的是事件。非常主流的模型,大家还是嗯更多的是去做这个参数量的一个扩张啊。然后大家可能更希望通过参数量的扩张,比较直接的获得智能水平的一个提升。那国内可能今年主要是做三T,然后海外去尝试从五T到十T这个拓展。 然后我们单次的这个激活比例,现在可能最低的就是Kimi嘛,2.8T的模型单次激活50B。嗯,后训练的分歧还是比较大的,后期练我觉得可能要击中。一个是说我们本身的目标函数和监督信号是有分歧的,因为可能有的函数是奖励的。嗯,人类偏好有的函数奖励的是AI的原则,有的函数。 他不设置一个绝对的目标,他是一个相对的奖励。啊,然后推理优化的话可验证RL。这主要是在一些有明确结果的问题上,比如。一些简单的数学问题或者代码问题,那这种问题呢,它都是。 有明确的结果,代码做对了就是做对了,那跑不出来就是跑不出来。所以这种问题呢,它就跟那个原来你需要一个明确的奖励函数有一些区别。明确的奖励函数这种东西啊。他其实 它它它它其实是可以是人类喜欢的那个答案,比或者是机器喜欢的答案。 他可能更偏感性,也可以更偏理性。嗯,包括tips可以为的节省成本,在四个后训练的那种函数里面,他可能只选出了两个吧,最后。那你选出两个,你就是一个比较的结果。就比如说你认为A答案好于B答案,所以你可能更 奖励A答案,惩罚B答案。 呃,这也是一种方式。但是在有这种明确结果的方向上,这种方式有点跑不通。为什么跑不通呢?你总不能说一加一大于等于八和一加一等于三比起来呢,等于八更好。 呃,等于三更好,等于三确实比等于八离正确答案近一点。但是数学这个东西不是对的,就是错的。啊,所以所以这就是在目前这种有明确奖励方向的东西上,后训练它其实做的是比较快的,因为 它可以通过一个可验证的一个结果,去直接让模型自己验证自己是不是做对了,去提升和训练的一个效果。嗯,然