您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [未知机构]:摩尔线程端到端技术分享20260723 - 发现报告

摩尔线程端到端技术分享20260723

2026-07-23 未知机构 张兵
报告封面

2026年07月25日23:51 发言人00:00 客户上的一些需求的对这一块的话可能我今天在技术层面给大家分享一些技术上行之有效的一些方法,希望对大家能有一些奇葩。首先第一个分享的就是我们在设计开发的一些经验和一些比较好的一些方法。众所周知,最近不光是几年,就最近几个月模型也在非常快的更新。不同模型,不同的框架,包括不同的算子,其实也都有非常快的发展。但是如此多的这种算法上的发展,其实对于我们的这个人是没有太多变化。怎么通过有限的人力去支持越来越多的模型,其实这个对于我们来说是一个非常大的对但是好在我们是一个AI的团队,我们是一个原生的靠AI去解决AI问题的一个团队。在这个方案,在这个方向上,我们也有一些目前走出来比较有效的一些道路。 发言人01:13 今天想重点跟大家分享的就是这个,我对刚才开了也讲到,就是我们的这个模式的架构其实和枯燥的兼容性的性是非常强的对这个钱其实不光是口头上说,在我们实际的研发工作之中也发现,不光是人写这个故障的代码,可以很方便的远程模式的代码,包括机器也可以很方便的去自动的生成功效的一些优化。预算坑这块其实在不同的这个行业的的一些伙伴,像google华为的AMD其实都有一些比较好的经验。我们的话其实在目前说A的A这个上面也有一些非常好成有效的一些经验。这是我们用user的可能给你一句话,这个算子的效率的一些方法,最主要的就是一个time。对像我们的话这个模型其实目前用的是一些标准的通用的一些大模型。因为这些大模型的话现在进展非常快。其实写代码的能力也是7月1对用大模型写代码的水平其实是非常不一样的。有的时候同样一个有优化的不同的人性化的速度,可能会有千差万别。 发言人02:44 现现在有一个行业里的共识是modelisacommodity,honestismost,就是这个honey是一个护城河。我们其实也是重点发力在这个层面。比如说用最先进的一些model配合上我们的这个modeharms,就可以形成一个算法优化的一个闭环。向左边这张图展示的就是agent与model,那怎么去优化呢?这个优化的方案其实是一个HITL的用的一个方案。每次这个agent全球化之后,其实是中间是经过一些ofresponse的一些流程,就是AE的会给其自我一旦自我收敛一些 教训经验教训,然后通过这些经验教训去看到每一版优化的效果是不是能够变得更好。如果变得更好的话,会把好的经验积累下来。如果没有人更好的话,也会把教训积累下来。 发言人03:44 在这个过程之中,人家会经常陷入一些local有的时候AI会换一些领导家。这样的话人在里面的这个作用,就是专家的这个作用其实也是重要的。他会把专家的一些经验去放大,然后不光是在一个算法上的经验,能够去优化策略的上,才能把这个经验去淡化,让AI能够把这些经验,所以这里面有这个经验。闭环是上一个算子的教训,就是下一个算子的起点。经过这样的一个闭环,其实我们现在就可以去很高效的去通过AI的方式去用这个流程去优化计算的一个算法。 发言人04:30 这是我们这个算结算的一个例,就是像我们这个MBC上有一套达摩斯的推理框架,叫MEC的VR路上。这个标就是在最初的一版适配其实都是人去做的。但后面的话因为这个模型包括算子越来越多,其实人挨个做这个效率是是这种天花板。所以靠我磕到的这个agents,我们可以在一周之内,把这个最核心的专业分析的设计还有一个很大的一个优化,整个的PPS跑这个新的30的1个3D可以从17到19,这是这个AI加上人工的一些优化的路径,我在这个地方演示了一下。 发言人05:21 除了这个鸳鸯公测之外,另外有一个框架其实是从0到1最近去开发。这套方案的话这个方案的话也是充分的验证了AI加人工具开发的一个全流程,全都是什么样的呢?首先我们去另一个agent去解决这个算子视频。先从0到1的把这个框架能够跑起来。因为像妈妈的CP其实在观测有一些它的一些优势。比如说它的这个情非常快,然后包括它的这个量化非常的灵活。比如说像Q4Q第一次的话,Q2Q3他都不支持。并且在这个观测的话,它的这个推理效率也是专门为了观测而设计的一个非常适合他做的一个方案。 发言人06:12 但是它的适配其实比两三更麻烦,因为它是一个成交量的一个框架。就是传统通过人力去适配的话,其实是这个工作量是非常比较大。但是我们通过这里面的一些actionview,像咱们咱们公司support可以去自动的分析,不支持这样一个政策。然后在接出来产品之后,再通过一些 自动的一些风险去适配。其实可以比较快的去把一个框架从0到1的迁移到风险的上。 发言人06:49 对这个流程的话,同时也可以去支持社区的版本更新。因为社区的版本现在迭代也是越来越快。是这样的话靠这样一套agent就可以去很快的把社区的版本去迁移到部分上面。但是单纯迁移的话,大家可以看到,其实这个速度其实只能满足一个跑动的对,但是跑通的话,其实在我们现在这个很快的行业竞争的这个条件下面,其实没有有意义的那怎么从快跑的快,要跑的好呢? 发言人07:23 中间其实一个很重要的一个事情,其实做一个分析。我们还有一些内部开发的一些view,去自动的去判断这里面的这个算子的一些瓶颈。比如说这个是我可以去进行判断,这些算子是时间占比靠谱的一些算子。同时它的这个带宽占了整个硬件的算力带宽有多少。比如说他也讲到我们有几个带宽规模是102或者130之类的一些带宽规格。如果某一些算子它的时间占比高带宽占比低的话,一个非常值得优化的算法在以后阶段,在review阶段我们也会去自动看他的算力占用率。如果说占用率低的话,会重点优化这个算法。所以第二步的话,我们的这个培训者能够去自动的分析整个算子慢在什么地方,然后有哪些重点的算子是需要去重点规划的那有了这个数据之后,其实刚才提到的这个POA的入口流程就可以充分的作用判断出来比较这个重要的算法之后,我们只会去用一些更先进的一些设计优化的一些skill去去高效的去自动的优化这个设计。 发言人08:45 对,在我们现在的经验来看,其实可以现在很快的通过这个H去把算子优化到百分之。当时的SOL。SOL是我们内部经常说的一个词叫stayback,就是分类的天花。那靠这个的话还可以自动的去把一些结论沉淀到我们的一个corporationMD的一个文件。这样的话无论是正向的优化经验,还是一些负向优化经验,都会去得到一很好的积累。 发言人09:16 这样的话一些新的算子其实有很多的支持是不用的。像比如说像斑马的CPP里面,其实很重要的一个事情就是这个数据类型的解剖。比如说从Q4的1个数据类型找到1.8的一个矩阵类型去 做计算。那底层对应的这个汇编语言进行很好的去积累到一个预算地里面对。这样的话其实相当于用这个AI的方式自动形成一个很好的一个编译器的一个支持。然后整个的AI就可以去充分的去做全流程的一个。 发言人09:52 好,第四块的话。就是。就是整个的一套流程,现在我们也已经搭建的比较完善。一个是这个流程的一个自动化,另外就是可以去做一个知识的一个沉淀。 发言人10:18 我们的最新的一个效果,其实在这个地方,现在我们的那个WCDP里面发了第一个版本。内部的话马上还有一个更好的,会发第二个版本。现在整个的效果,所以36签到3.6,35A3B的话,剩下我们这个以后的速度大概是20.6。然后view的速度大概到18,那32个信号我的话整个的速度到15.4。这一块的话也在更快持续的优化之中,就是会比之前的人工优化的效率会高,提升非常,这是在新的方向,从到一是用AI去服务开发的一个经验和流程。 发言人11:03 除了这个大模型的方案之外,刚才也介绍到,我们也有一些传统的模型的一些预防方案。传统模型的话我们也会收敛到这个框架叫产。传统的这个模型它虽然没有大模型那么好,但是其实适配的难度是比大模型更高的。因为大模型其实还相对比较收敛,小模型的话其实这个会更长远,模型的这个算法更多。对所以包括一些算这个计算图的优化,其实这个工作量其实更大。 发言人11:40 那现在汪峰他们刚刚算这个推理框架的,我们已经开发成一个纯定制的去开发维护的一个。那这个框架的话就举一个例子,就是一个视频插帧的模型。经过一天和一人力的优化,其实把这个FPS能够极大的提高,并且能够达到客户的一个交付的一个标准。对这一块我们也是希望能够去快速的爆发式的一些模型的一些优化和上线。然后在这个过程中积累这个产品的产品,不断的去完善和优化这么一套配置的一套方案,就是看高估下的一些实际的一些效果。 发言人12:29 在模型上我想总结一下,就是这个工作就是有限和无限的无限有限的能力,无限的这种能够满 足无限的这种需求和这个行业的一些进展。然后答案我们现在看到的答案就是通过哈姆一个A的方案,有了比较好的一个推理方案,其实下一步就是有一些好应用。那应用的话我们有几个典型的应用的方案。比如说像这个数据这一块的话,其实也是充分发挥我们专场这个AI的一些全栈能力。 发言人13:13 比如说像这个GPU,他在里面去做这个口型的驱动。包括刚才他也提到我们是唯一唯一一套全端测的方案,就是进入了我们一些小模型推理的一些推理框架。推理性。比如说一些大模型的一些推动型方向,包括本地的一些排气的一些方案,其实都在里面,是一个比较全的一个方案。包括这个视频的编码解码,然后包括整个的一个显示,其实都是我们快一三百去完成的那最近我们负责他们的一些进展,其实主要有这几条。 发言人13:52 第一个,我们的这个方案也有一个很好的一个时代,这个是源于很好的算法和模型。首先就是嘴部的这个分辨率,现在是可以有一个四倍的一个提升,成交2384和384。然后第二个就是我们现在的这个数据也支持一些bodylanguage,就是他之前下一步后来的话我们做了一些随机动作的一些导入。现在的话可以通过这个音频的时间戳和语义,然后去自动的插入一些和声音和这个语义匹配的一些。然后第三块的话就是本地的这个唇IG的方案,包括我们支持上下我们的一个大模型方案,其实也落在我们的这个数据信息里面,就是这个书本的一些进展。对,就是我们想听会记录,就是会有一些语义的一些动作。 发言人14:56 除了这个人之外,最近其实非常火的,其实也是A的,尤其是像龙虾这种。在比如说在我们的AIbook或者是这个伊斯曼模组上面,其实也都可以跑这种,包括我们自己也有一套带A这个的一套数据系统,会去在这个AIQ。这里面也有一些我们最近在优化A组的一些思考和经验。 发言人15:29 第一条经验就是A制的评测。因为H的这个事情的话,就是可能大家刚出来的时候觉得非常的兴奋,因为他可以做很多模式。但是其实在我们看来最重要的就是先去明确它的功能边界,去做一个可量化、可恢复、可分析的一个match2。只有有这个match2之后,才能有量化的一 些分析目标。所以这里面的话我们有一套自动可可以自动评测的一套工具。并且这套工具也都已经开源到了这个非常方便大家可以去进行使用。然后同时就是我们的这个agents和我你的这个数字能有一套联动。这是联动的一个技术框架图,是通过这个插件的方式去接入负责的一个前端的系统,包括和微信CC也都可以打通。 发言人16:26 那在联动的过程中,我们在这个标准模型的基础上也做了一些相关的一些技术点的一些改动。包括像这个ID道是我们开源的一套针对AC的一套加速技术。这套加速技术主要的工作原理是通过一个子类问题,去把一些前置的任务去做一个快速的执行。同时也可以去判断的,比如说这个正在执行的任务是不是可以胜任。如果可以胜任的话,他就直接可以去返回执行的结果。如果不能胜任的话,会去直接交给上游的更大的一些模型去完成一个工具调用和一些任务的一些继承。 发言人17:20 这样的话就可以通过小A的快速快速推理和快速执行的一个一个方式方法,去极大加速端到端的一个时间。这是一些速度提升的一些数据。在极速模式下面,我们会比这个faceone的方法能够提升七倍的速度,然后整个的完成率5秒钟。这是我们发现