00:01:01各位投资者大家好,我是东吴汽车的研究员佟明奇。今天我们讲A系列深度的最后一篇26 00:01:09 00:01:11怎么样才能够在毫秒级的车端去跑起来,核心结论也是我们先说就是学术上的scanni 00:01:19ng,追求的是训练算力最优。 00:01:22他的目标函数里面根本没有推理成本和毫秒级时延这两项。 00:01:27所以我们在训练侧做规模的扩张逻辑,就不能直接外推到车端部署产业最终形成的一个分工 00:01:37,我们概括称为是云端探索上线车端。保证实时。今天依然是几个部分。 00:01:45 第一个部分是讲scding诺和这个车端部署的错位。第二部分,我们讲云端侧的效率优 00:01:52 化,第二部分我们讲这个云端测的效率优化。 00:01:56第三部分,我们讲车端部署蒸流上车和快慢系统。 00:02:00第四部分我们总结一下,首先进入第一部分就是学术上的最优和车端的最优,根本不是一件 00:02:08事情,经典的scanning law缩放定律,以给定的训练算力的损失最小化是为目 00:02:16标,它的最优指向是训练算力的前沿,而不是实时部署的这样的一个系统。Plan在这个 00:02:242022年2020年的提出就是损失。 00:02:27 随着参数量、数据量和算力呈现幂率规幂率变化的这样的一个规律结论是偏向于扩大参数规 00:02:36 模。 00:02:36对应着1.7个训练token,每个参数啊那么是啊比较关键的scaling的一个基 00:02:45础学术的scanning和这个车端的工程约束。 00:02:50对应的不是同样的一个优化目标,前者并没有把这个推理成本和毫秒级的时延纳入目标函数 00:02:58。这句话是我们整个专题的一个起点。 00:03:01一旦把这个推理和部署成本纳入这个目标函数,那么最优点就像更小的模型,更多的训练数 00:03:11据进行偏移。 00:03:13那么2024年当中,satden在这个scling law当中显示加构了推理成本 00:03:21之后,提出在高频的部署场景下,算力最优点会像参数更小、训练更一更多的这样的一个模 00:03:28 00:03:33那么在产业实践当中,也已经体现了这样的一个导向。 00:03:37智能驾驶进一步强化了一约束模型必须在固定车规算力上同时满足帧率、时延和功能的安全 00:03:48性要求。 00:03:49那么我把具体,再把这个约束具体说一遍,就是在车端计算单元上,用学术界期望的不低于 00:03:59 30赫兹的频率运行大型的视觉tran加大语言模型在现有算力下仍然具有比较高的一个 00:04:09 我们说30赫兹对应的是每秒30,对应的是每33毫秒,叫要一完成一次完整的感知加推 00:04:17理加决策,这是很硬性的一个门槛。 00:04:21和云端可以弹性的扩展不一样,车端的算力平台相对比较固定,比如说我们一开始用的这个 00:04:27英伟达only x大概是254 tops。Int 8的1个算力。长期被应用于我们 00:04:34比较高阶的辅助驾驶平台。 00:04:36现在有了这个索尔耳已,从2025年开始上车主流版本现在是索尔优,大概是每颗700 00:04:44tops比如说理想、小米。 00:04:47还有极客的这些车型都已经去搭载索尔优了。这一页我们给出一个比较实际的实测数据,是 00:04:56判断大模型上车成熟度最直接、最难造的一个指标。 00:05:02 我们先看具体数字,就是理想披露它的VOA的推理帧率大概是十赫兹啊。相较于上一代的 00:05:10 VO的慢系统大约3赫兹提升了三倍多。 00:05:14 英伟达也是提到了这个端到端的推力时间是99毫秒,那么大概是十赫兹的这样一个水平。 00:05:22小鹏说他的第二代via把这个指令输出的实验压缩在了80毫秒以内。00:05:29把这几个数字跟这个学界期望的30赫兹的参考线放在一起。00:05:33就是我们能得出一个结论,当前,量产大模型的实际推理帧率仍然低于研究提出的这个3000:05:40赫兹的参考水平。十赫兹意味着这每100秒才更新一次决策,每100毫秒更新一次决策00:05:48。00:05:48但是在车辆在比如说80码的时速底下,100毫秒要走过2米多,这个就是后面两部分需00:05:56要解决的这样一个问题。00:05:59我们看第二部分云端是怎么压缩这样的在固有算力上的和复杂度上做减法的。00:06:07首先我们把两侧的这个分工界定清楚,云端压缩和车端压缩的边界是在于优化对象的不一样00:06:16。云端侧主要降低模型固有的算力和复杂度,重点在算法和架构层面。00:06:23车端侧是在固定车端的这个呃算力规模约束下实现低时延的部署,重点在这工程层面和系统00:06:31 层面。 00:06:32美云端测现在可以归为四了,比如说降低这个模型的容量和注意力缓存基金缓注意力的,还 00:06:42 00:06:47再再比如说这个削减输入侧的视觉token这种余,再比如说压缩推理当的思维链。 00:06:55再比如说用这个加速训练和这个仿真测的世界模型。 00:07:03通用基座的效率优化。 00:07:05 用这个那稀疏激活还有注意力与压缩缓存低精度投机解码为主,为车辆部署提供了比较可以 00:07:15复用的上游技术环节。最重要的是这个混合专家moe,就是每个token只激活一小部 00:07:25分的专家。 00:07:26把模型、容量和单子的推理算力解耦。 00:07:29 00:07:37数只有37B,就是这个专家模型。 00:07:42那么这边再提一嘴,就是车端的ME和云端的ME并不是一回事,云端大模型的MUMOE 00:07:50以总参数百亿乃至于万亿激活数,大概达到有10亿的水平。专家数是以百为单位去进行这 00:07:59个计算的。 00:08:00这个在车端,他们受限于欧X索尔的固有算力和内存带宽模型通常被压缩到10亿参数以内 00:08:09 00:08:10这样的量身定制的moe就是一个比较激活更加小参数的这样的一个系统。 00:08:20后面我们来提这一类的云端优化,是视觉token的一个减脂,VOA输入当中的这个视00:08:26觉token的数量远远高高于这个文本的token。 00:08:31 00:08:38 00:08:46 00:08:50那么浮点运算量的时验分别下降了50%、59.1和38.2,成功率提升了这个2.6 00:08:57%。 00:08:58么再比如说小鹏和个北京大学合作的这个fast drive v1A专门为驾驶设计采 00:09:06 用重建式前景,偷Ken减脂的这个方法。 00:09:10那么把这个token由三千多降低到800多计算量减少了7.5倍。另一类方法是用这 00:09:21 00:09:27 00:09:31 比如说中港中文的和个小鹏的一个合作的future x就是用这auto think 00:09:39的开关来判断这个场景的难度。复杂场景由影视的这个世界模型去进行未来表征的一个推导 00:09:48 00:09:48再比如说小鹏第二代VA当中,把这个视觉visual cot引入提升了32倍的这样 00:09:56的一个效率。然后来保障它的实时的这样的一个运行。 00:10:01 前面是讲的这个云端的部署,下面我们来讲这个车端部署,车端部署主要是三个路径。 00:10:11第一条路径就是把云端账大模型去蒸馏,蒸馏成为可以上车的小模型,实现云端能力向车端 00:10:19迁移。第二个路径就是用快门的双系统去运行的时候,去分离、快速的响应和复杂的推理。 00:10:26 第三个路径就是用比如说量化、投机解码、压缩这个采样步数,编译优化这些工程性的方法 00:10:34 00:10:39我们先看第一类,就是云端大模型蒸馏上车,云端训练高容量的成为一个教室模型,然后车 00:10:48端运行是一个蒸馏后的学生模型。 00:10:51比如说以这个vi某为例,它的foundation model适备出了这个driv 00:10:56er simulator、your critic三大教师类模型。 00:11:01因为体积过于庞大,没有办法在车端实时运行,需要安全蒸馏为更小的一个student 00:11:07的一个学生模型。 00:11:09在车端架构可以镜像基座结构,并且独立的设置了校研层来实时生成个轨迹。 00:11:22那么这个校验层就是把安全兜底,从模型内部搬到了这样的一个外部。 00:11:28第二类是个快慢双系统,比如说理想,早期就采用了这个end to end加vio 00:11:35m的双系统啊系统,一是这个n end to end的这个端到端模型。 00:11:41直接由传感器输入轨迹运行一颗个orx上面,第二个是一个比较大参数的22亿参数的一 00:11:50个VOM模型。用思维链的方式去做复杂的语义推导。 00:11:56并且把反馈呃提交到系统一。 00:11:5995%的场景都用系统一,第三条路径我们说是这个量化解码和编译,就是一些工程化的手00:12:10段。 00:12:12那么在量化和编译方面,你想在这个底层推理引擎,在这个orx上用int 4的运行了 00:12:20这个vo m在索尔上用int 8和FP8运行VOA。小鹏就用这个芯片编译器和模型 00:12:28 的联合优化。 00:12:29把这个基座编译效率提升了12倍。但解码和采样的方面,理想贸的vio a用了act 00:12:36ion token进行解码思维链使用。 00:12:39这个小词表叠加投机推理,并且用这个OODE的采样器有是扩散流匹配,把去噪步数从十 00:12:48步压缩成了两步,并在这个十赫兹的帧率下改善响应的一个时延。 00:12:58我们去看这个云端训练的算力,大多数是个车企和厂商去进行合作构建的头部的这个基座实 00:13:10验市场,成为上游供给的学术供给。 00:13:15那么在云端算力的层面,国内的主机厂有有和腾讯云、阿里云和字节去进行一个算力合作的 00:13:25这样一个情况。 00:13:27比如说这个。 00:13:34目的是缓解这个高算力AI芯片带来的获取约束,小鹏的云端算力大概是在10亿flol 00:13:42ops长期利用率保持在90%以上。 00:13:45那么理想的云端呢大概是在13亿flops,那么3亿flops是用于推理,10亿p 00:13:54 么在上游基座侧,这个deep stick mini max阿里的千问还有这个k密00:14:00,还有质朴这些,都走以moo e为主的稀疏化的一个路径。 00:14:04路线持续的向这个产业输出,可以被驾驶模型借鉴的这个技术效率就包括这些ME、MOA 00:14:12线性注意力机制,以及投机解码等等。 00:14:17今天讲的这个实验专题,我们就讲到这儿,也感谢各位投资者,听了我们一整节数字I和物 00:14:26理I这样一个系列,我们后续也会集中在个股来把每一家的个厂商的情况去做后面的进一步 00:14:36 的这样的一个梳理。 00:14:38 也是再次感谢大家支持这个东风汽车,我们这个系列就到这儿就结束了。