您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [未知机构]:国金具身智能 数采物理AI最大短板数据基建即将爆发 - 发现报告

国金具身智能 数采物理AI最大短板数据基建即将爆发

2026-07-17 未知机构 飞鹤萘酚
报告封面

00:00:01 大家好,欢迎参加国金具身智能数采物理AI最大短板数据基建即将爆发。目前所有参会者均处于静音状态,下面开始播报声明,本次电话会议仅面向国金证券的专业投资机构客户或受邀客户,仅供交流研究观点。专家发言内容仅代表其个人观点,会议内容并不构成对任何人的投资建议,未经国金证券事先书面许可,任何机构或个人严禁以任何形式将会议内容和相关信息对外公布、转发、转载、传播、复制、编辑、修改、解读等。涉嫌违反上述情形的,我们将保留一切法律权利。感谢您的理解和支持,谢谢。 00:00:50 哎,各位领导早上好,我是国金聚深智能组的分析师冉婷。呃,最近因为发现了整个人性机器人板块,可能比较大的机会或者最大的机会就是来自于数据采集啊。所以给各位汇报一下我们最近写的这个呃数据采集深度报告。 00:01:09 嗯,背景是这样的,因为我们可以发现,呃整个特斯拉机器人包括在内的这个全球机器人,他们呃一直就是放巨量,以及在具体场景落地呢,呃一直有一些瓶颈。核心的原因呢就是大脑是比较卡脖子,嗯然后大脑卡脖子呢,又是因为高质量高保真的物理交互与真实信息是极度缺失的。嗯,那现在来看的话,大语言模型它是有万亿级的token训练,但是巨深智能模型可以用的真实的交互数据是不到他们的万分之一的。呃,所以就是数据卡导致大脑卡,大脑卡导致人形机器人真实的呃真正的下游应用落地啊,呃,是还在卡瓶颈的。但很好的是呃, 00:02:03 我们今年看到了一个数据采集的爆发,意味着这个数据采集呃爆发完了之后,呃可能会带来一个具身智能大脑模型的初步的泛化。呃, 00:02:17 具体来看的话,就是呃,我们现在全球大概有的这个数据体量呢,就是在。50万个小时左右,嗯,但是这个数字水平就只相当于我们一个人一辈子活的时间,就大概3万多天, 乘以每天睁眼的时间大概有个呃十几个小时。就50多万个小时的这个呃整体呃睁眼的时间,就相当于我们现在人呃这个整个全球人形机器人就是50万个小时。那这一个人的一生肯定是不够的,因为遇到的情景场景还有行业信息等等都是不足以够泛化,让机器人去去训练,并且产生一定的呃智能化的涌现, 00:03:09 所以我们预计的话还是要往上走的,可能以后是1000万个小时,也有可能是1个亿,呃1000。呃,1000万个人对应的小时数量啊,或者是一个1亿个人对应的小时数量,嗯,那现在来看的话,嗯,整个GPT2和GPT3的训练数据分别对于大概79万到1100万小时,呃,要实现。可用的聚生智能至少要1000多万个小时的多模态数据,嗯,所以的话这个数据量呢开始在大幅的提升,从50万个小时提升到1000万个小时。蜜蜂呢已经将目标数量级呃,提升到了呃2030年100亿个小时的采集目标。呃,那我们整体来看就是这100亿个小时也是一个非常大的量,而且只是一家,呃, 00:04:11 后面因为可能有像京东、像阿里等等这样的大的呃素材商,或者说大的应用商也会进来,那有多家机构会采集以及。 00:04:25 采集的量率我们现在来看还是非常低,可能只有20%~百40%, 00:04:30 所以最后导致这个实际需要的数据量呢,可能是远超过一一百亿啊。嗯,但100亿单独来看也是不小的一个体量,因为100亿乘以一个单价,假设有100块钱一个小时的话,也是1万亿的一个市场空间了啊。所以我们还是呃非常看好这个数据采集带来的一个大的空间,然后接下来我来详细讲一下这个报告。 00:04:58 啊,整个现在来看背景,呃,也就是说其实人形机器人大脑这块还是对数据需求比较大。那今年的话数据采集呃,其实也是今年人形机器人订单的主要啊来源。 00:05:15 我们采集呃数据采集这块,我看在2025年啊,整体占到了人行订单里面的大概31%左右。今年我估计是只多不少,可能超过50%的一个呃最终的呃订单来源就是数据采集需 求,包括呃各种数据采集中心,还有各种人形机器人它自己的这个嗯本体公司内部的一个采集需求,嗯具体来看的话就是在嗯。像头部的公司,比如说智源宇数零次方星海图等等,他们都呃自己也在开数据采集厂,还有他们也专门发布了一些数据采集的呃本体。 00:06:02 那素彩中心呢,整体我们看全国也是从2025年开始呃密集建设,其中比较大的就是致远的素材厂,他一家就可能有3000多平方米啊,然后每天才3~5万条。呃,后面呢我们还有一个非常详细的表格。呃举例呃大概收集了统计了一下,这个现在全国有大概15~20家的数据采集中心,每家的这个布置的人形机器人大概是有100~200台啊呃,后续的话这个量级还是不太够,因为整个人形机器人的本体数据来看的话。嗯,它存在一个人形机器人出货量少,导致它的整体占比在人形机器人的呃真机数据里面,可能是一个比较小的占比,最后只占10%左右。 00:07:01 比如说今年致远打算目标才1000万个小时的话,可能就100多个小时是来自于这个呃真机本体数据。剩下的嗯90%是另外的,比如说5米和ego这样的一些数据中心啊啊数据来源嗯,所以刚好讲到这个数据采集的这个方式呢啊。 00:07:28 给各位展开一下整个我们现在全球的数据,特别对人性这块,嗯,99%以上都是合成的或者是互联网的这个数据,嗯,他们规模大但是效果比较弱一点,他们噪声比较大,所以很难产生人形机器人大。 00:07:48 大脑的真实泛化呃顶层的这种真实数据主要包括啊,机器人的真机本体啊可以收集每个关节的运动信息啊。第二是要操作像物米呃,就是通用人形机器人抓甲呃这样的一些呃物密信息的话,它是可以同时采集触觉还有关节运动信息,以及手部的呃这个部分的一个视觉。 00:08:17 相机采集的这个视觉信息综合起来也是一种多模态啊,最后还有一个E构数据,E购的话就是我们人嗯。带上这个采集模组,比如说以后京东里面做家政的阿姨或者家庭主妇被外包之后,她们做家务就会带上一些E购采集的呃图彩相机也好,手套呃这个眼镜也好。然 后手部可能还会有一些监测型的相机,一起去收集呃后面这个包括家庭场景在内的各种场景的数据。而且因为它的一个形式比较轻便,然后价格呢相对会比其他方式会更低廉一些, 00:09:00 现在也是一个非常啊应用程度非常广泛的一个一个采集形式啊嗯,刚才讲1000万个小时里面可能有个百分之三四十都是一购的数据,嗯它除了这个整体呃。比如说它的轻便性之外啊,还有很多其他好处,待会儿会展开讲啊。 00:09:23 我们现在先展开讲一下具身采集的各种形式。第一是遥操作,这个是比较传统型的啊。遥操作呢又分为三类,一个是未知,一个是视觉,一个是光罐类啊。未知的话比较火的就是aloha,它是嗯前面像像左下图这一个样子,同构类呃左下图这样子,前面放一个呃机器人的呃机械臂还有一个底座,然后后面一个人去摇操远呃稍微远的这个同构摇操。嗯,那特斯拉呢一开始也会采用这样的一些方案,呃同时我们了解到手部呢特斯拉也是比较喜欢同构类的。 00:10:05 第2个就是视觉类的采集方案,呃像这幅图中间这一块的就是。呃,左边有个人也是在嗯,就就周围整个房间有相机模组在拍人的动作信息,然后右边是这个机器手臂就同步去模仿人的,呃同步去跟随人的一个要操信息去操作啊。就后是光罐类的啊,呃就是光光学加惯导嘛,上面带一个VR头显啊,这个也可以通过呃这个VR头显的一个呃监测功能,去了解到手部的一些动作啊,进而去嗯采集一些人类才拥有的动作数据。这样机器人就知道人有这样的一个动作数据之后,它才能够真正地复刻啊。 00:10:57 这个是第一大类的技术,就是要抄嗯。第二大类的话就是动补,就是穿上各样的动补服在一个特定的房间内啊,这样可以非常精确地了解到呃人体各个关节的动作数据。它呃确实数据的精度会比较好,但是问题就是太贵了,可能一套动捕设备要几十万人民币啊呃,第3类的话就是呃这个仿真数据了,就可能会相对于呃单条数据成本会比较低,也可以无限生成。但问题就是它可能很难去嗯或者说它因为是仿真的,所以可能有一定的幻觉,然后真实的世界里面又很少遇到这样的一些呃幻觉生成的场景,所以会产生较大的不匹配性 啊,所以最后比较需要的我们人类需要的机器人。 00:11:51 前的这个数据还是呃真机数据,然后现在全球只有50万个小时嘛,嗯,那呃所以大家就想到一些有高性价比的方案去替代。那今年出现比较好的一种方式就是易购,也是因为斯坦福的呃关于E构呃,或者说叫第一人称采集运动数据水平的这个呃相机呢,开始大幅的产生比较好的作用。 00:12:19 大家发现,两万个小时的异构数据就可以让机器人的智能化水平开始初步的涌现。比如说你给他两万小时的异构数据,嗯再让他学习一下,再给他一个40秒的洗碗的视频,他就诶开始呃自然会可以洗碗了,就会呃智能化大幅的提升啊。所以大家在想,两万个小时都这么好,是不是100万个小时,1000万个小时会更好啊,所以今年来看的话,嗯。 00:12:51 整个下游包括1级和2级呃都在疯狂地去买素材设备,我们也是从今年年初呃财业链的相关调研信息可以发现,像数据采集手套啊灵巧手呃以及像。素材、相机这几个环节的订单是供不应求的。呃,所以才发现这个整个数据的采集这块儿已经需求呃起来,所以赶紧写了这个报告给各位领导汇报。嗯, 00:13:21 整体来看这个数据信息肯定现在的量是大幅在提升的,但是以我们现在整体需求的1000万个小时也好,1亿个小时,100亿个小时也好,还是非常的这个差距大啊。我们预计呃今年呢到明年呃,很多厂家会陆陆续续开始采集,上千万个小时的数据集的一个数据采集量啊。呃今年已经有像京东,致远和星海图这些头部玩家公布了千万小时级别的数据采集目标,呃参与的主体也是非常多,我们也后面会梳理一下产业链。 00:14:02 现在先给大家看一下啊,这个表也是展示了量级比较大的公司,多的就是京东、智源、新海图啊、蜜蜂这几家。嗯,其他的第二梯队的可能都是百万小时的啊,当然呃这个数据量我们预计千万个小时。呃,如果在数据的质量包括它的良率也好,包括它的模态和覆盖失败数据这种呃多个方面都表现比较好的话,真的可能让机器人产生初步的自动化涌现。 00:14:36 但问题就是,如果比如说嗯在非是呃过非正确或者非成功信息,也就是失败信息上呃有缺失的话,还是会有一点嗯难办。 00:14:49 比如说非成功数据指的是哪一种?比如说我们去洗碗呃然后碗滑掉了之后,我们人的手是知道呃可以再把它拿起来重新洗嘛,但机器人呃,因为我们没办法没没给他提供过这样的失败数据,所以它不知道怎么去学习啊,所以最后导致可能呃实际有1000万个小。小试数据,但积累的量呃都在集中在一些比较简单的场景的话,呃,可能实际上机器人泛化的一个一个能力还是比较弱的,所以最后还是得看数据质量。所以现在高精度高呃这个高质量的数据其实是非常缺乏的啊, 00:15:33 要有这样的数据的话,我们理解还是要整个社会的各个环节都参与进来,嗯,然后哪些地方有投资机会机会呢? 00:15:43 我们梳理了一个产业链,我们预计有四大环节是有投资机会的。第一个就是数据采集设备,第二个呢是数据采集公司的本体啊,呃,也就是这个一些专门的第三方的素材公司,第三的话就是数据呃这个。本体呃公司比如说提供机器人的呃本体也好啊,他自己下场做数据也也好啊,最后就是一些呃这个仿真平台,像呃所成还有英伟达这些,他们的仿真平台上可以提供很多数据啊。所以我展开讲解一下每个产业链上的一些投资机会也好, 00:16:26 还有一些呃参与玩家也好啊,还有竞争格局。 00:16:30 那首先是数据采集设备,我们预计这一块是投资机会最大的,嗯,尤其是嗯。 00:16:39 就是每一种数据采集类型都会使用到的核心硬件,刚才提到的要操作5米和呃ego也好,呃所有的人形机器人的数据采集都会用到呃三类素材硬件,第一个就是相机,包括像egocent的相机、乌米的相机,还有人形机器人上面用的眼睛相机等等。第二类的话就是呃触觉传感器,第三个就是IMU。 00:17:09 嗯,这块每块的一个呃公司呢,我们