您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [未知机构]:商汤集团0020HKWAIC2026基座大模型架构创新与生态合作论坛 - 发现报告

商汤集团0020HKWAIC2026基座大模型架构创新与生态合作论坛

2026-07-18 未知机构 江边的鸟
报告封面

00:00:00 就取得了这个进展啊,就就是他后来很快就取得了进步,也就是说他是有self evolve提升的能力啊,自我提升的能力。但是我们这上没有,那再进一步说他,我为什么不能赋予呃我今天的智能呃,就是这智能体就是自我进化的能力呢啊,确实大家有各种各样的路线,但是现在。 00:00:20 大家发现了一个现象,就是说我跟在真实中跟环境做交互的候,它的信号它的语义,呃,就信号的语义性以及知识的密度是极其稀疏的,我很难从这种极其稀疏的东西就不经过人类加工,在中间做语料清洗,就很快地让它自我提升。然后大家想啊,这是在语言上我们遇到的问题,我们视觉上遇到难道不是这样的吗?也是我们很希望就是呃,就是那个模型能够跟这个视视觉的这个自然环境做交互,在这个交互中学习。但大家也说了,这个交互的信息量非常非常非常的稀疏,所以它似乎不如语言高效,但是语言也好不到哪去啊。 00:01:01 今天一旦你考虑到动态的场景,而不是那种静态语料场景,你也得面临这个问题,也就是说,呃,在静态语言我们之之前。就是不管是大家做那个chatbot还是说reasoning啊,在就叫所谓的静态学习这个阶段,可能呃大家面临就是通过大量清晰语料这种方式进行学习,可能自然语言占据了非常大的一个优势。 00:01:26 但是在未来走向动态走向在线学习到走向这个自主学习的时候,你发现语言跟视觉面临的挑战是一样的啊对,那如果我们能攻克这一条,那其实也就不不存在所谓的就是语言和这个呃,就是那个就是语语言和那个视觉这个争议了啊。可能我们都要做,而且视觉像刚刚老师提到的,它有非常丰富的交互和非常广泛的应用前景,呃,它可能maybe是比语言更重要的一个训练场或者智能体提升的途径。 00:01:58 好的,谢谢翔宇啊,我觉得这个观点还是很深刻的啊。志伟嗯,对,我觉得可能从呃三个层面可以看这个问题,就是语言和多模态。可能如果从一个哲学上看,有点像那个柏拉图的洞穴,就是我们语言其实是整个真实系的一个投影,一个低维投影,就有点像刚刚那个呃翔宇老师说的这么一个观点,但是我们真实的世界其实是一个更高维的一个世界。我们在第一个阶段当然可以在投影中学习,我就在这个柏拉图的洞穴里观察这个投影,然后去总结世界的规律。但终归人类是需要迈出这个洞穴,对吧, 00:02:34 走向真实的世界。那可能第二个角度是从数据的角度来看这个问题,呃,这个和刚刚几位老师的观点是一致的,呃,第一就是语言其实有点类似于化石燃料,就是我们人类其实积累了很久,对吧?我们人类创造语言记录语言,包括整个互联网去把这个语丰富的语言得沉淀下来。但是化石燃料它终归是有限的,所以我们肯定会走向下一个时代,就是利用各种各样的。其他的能源形态那就是其他的数据,那其他数据是这种多模态的数据啊,这个我觉得是它是很难的,但是它是必经之路,有点像我们现在从化石燃料走向新能源的一个过程啊。 00:03:10 那第三个就是从任务的层面,那可能就是我们现在整个任务上会慢慢地脱虚向实,对吧?00:03:17 那比如在数字世界里,可能很多任务都可以被啊原模型去解决掉,当然肯定有分是解决不掉的,但现在很多高价值的任务,比如说制造业或者其他的这个任务,它一定是脱离不了多模态,而且可能多模态真的能涌现出呃下一代的智能。 00:03:33 好,谢谢啊。呃,就我们的刚才的第一个问题的话,我已经看到了这里面很多不同的思想的这个碰撞啊。你看从这个邱老师这里面的这个情境的这个智能对吧,然后还有这个呃其他几位提到的我们要回归到第一性的这个原理啊,包括这个翔宇老师提到我们的这个持续的进化,嗯,那么这些都是非常好的愿景。也是我们未来会期待要去达到的这样的一个目标。 00:04:04 但是当我们从这个第一性展望长期的这个AI的这个前景的时候,回到现实世界。那回到 现实世界的话,就是我们当前的主流的。 00:04:18AI的方法包括我们的这个数据模型的结构,翔宇老师提到的训练的范式。 00:04:26是不是足以支撑我们走到智能的下一个阶段? 00:04:31我们当前从现在的这样一个已经不错的一个高度上,再跃迁到下一个阶段来说。 00:04:40 真正的瓶颈究竟在什么地方?好,我们这次先从职位开始。嗯,对,我觉得可能这三个方面都不足以推向下一个阶段,可能都有改进的空间啊。 00:04:51 第一个就是数据层面吧,就是我觉得语言模型就是有点类似于一个,还刚好碰到一个恰好不错的一个时机。整个互联网发展了20年,积累了这么多语料,然后算力刚好GPU大家之前为了玩游戏对吧,也上升到了一个不错的一个程度,所以所有的要素都齐全了,大家刚刚好有人愿意scale up对吧,这个BAT成功了,那这个事情就走出来了。 00:05:13 但是往下一个阶段走,比如说多模态,那肯定互联网上也有很多的视频图片,但是它大部分是相对来说是呃静态的,这个静态不是指它temper上就是时序上是不是静态的,而是它并没有太强的长程关联啊。长程关联这个事儿,我们人都会去做,比如说我们日常大家做家务或者每天去工作,但这件事情是很难被记录下来的啊。所以现在有很多公司也好吧,政府也好会去主导。 00:05:41 去做这种所谓的数据采集,但是它是一个呃不太像是语言模型那那么很自然的呃无心插柳柳成荫,能够积累这么多数据的一个过程。所以这个如果有一个更好的范式能把这些数据能记录保存,能够呃标注下来,呃我觉得这个可能是下一代很需要的一个点吧,可能这个并不仅仅是一个技术问题,它可能也是一个更大的组织问题,社会问题。那第二点是架构上我觉得可能也是需要改进的,就是现在整体的架构还是以语言模型为核心嘛,就是整个 的一个大圆言模型为一个基座模型,然后多模态的能力以桥接的方式进入进去啊。那如何去做更原生的多模态啊? 00:06:20 原生可能包括两个点吧,输入输出侧啊,那输入侧怎么做到原生?输出侧怎么做到原生?这有很很多很多的问题啊,因为包括呃很很长的这个上下文对吧,然后非常稀疏,呃怎么做编码,或者说我要不要做编码,哪一层做表征,呃,这个事情是呃大家都不知道的,可能需要探索的啊。然后第三个可能就是。 00:06:41 就是那个学习范式,我觉得这个可能也是更大的一个问题。就这个问题,我相信所有做视觉的人都有这个感觉吧。因为从10年前大家就在讲这个问题,对吧?就是这个问题依然没有被soft,但我也是相信会有一个比较elegant的一个解法,可能能真的比较通过skinlaw的形式给涌现出来,这个我也非常期待嗯。 00:07:01 关于那个呃翔宇老师刚才提到的这个持续的这个进化,这个我也是非常认同,这肯定是智能未来要到达新的高度的一个很本质的一个一个途径。但是当我们走到这条道路上面的时候,事实上它是有很多不同的具体的这个做法,以及说不同的具体做法是有很多。 00:07:23 具体的挑战的就比如说现在很多人在工程层面讲的这个self self evolving,就不断写一个skill,不断的积累这个skills是这个这个做法。但显然我我想这个您也应该刚才也提到了,这是有个明显局限的一个一个路径,但是如果是像你刚才提到的像人一样的成长,对吧,它可以横跨几十年。直到今天,我们依然在这样一个机会,我们通过交流不断学习,不断去成长。但是现在机器的话基本上当然比以前好很多了,能够处理几个小时的一个任务啊。但是他比起人的这种贯穿百年的这种成长,从一个小孩子变成一个非常有智慧的人。 00:08:07 还不在一个水平线上,那么在你看来,我们怎么样去实现一个真正意义的持续进化?这里面有哪些挑战是有待克服的? 00:08:16 OK啊,我想我我想回回解释一下我对这个问题的观点啊。这其实刚刚林老师其实就介绍了,就是其实大家就是自主学习,我相信呃就是这个领域里头大部分人都是认可这个啊,但是具体的呃就是它可能产生的这个这个路径啊,其实不同人有不同啊,不同的想法啊。 00:08:38 在今天的这个模型能力啊,今天的模型什么意思呢?有一定长度的上下文啊,比较长但是还远远不够长啊,以及还有很严重的上下文退化的能力啊。对的。然后我靠靠工程手段,靠上层的harness手段就对我的上下做不断的上下文管理啊,然后做self evolve啊,然后让让相当于让模型的工作记忆片段呢始终保持在一个稳定啊,就不至于崩溃的这个区间,就是来获得某种记忆性性和这个进化性的某种平衡啊。 00:09:08 对啊,这是现在的一个很多人相信的一条路线,也有很多人在尝试,并且进展也速度也很快啊这条路线,但是大家在。 00:09:16 想啊,这条路线它的最大的问题是什么呢?啊对呃,如果你考虑到了多模态啊,其实呃这个问题就比较明显,因为多模态这个首先首先显而易见的一个问题,就是多模态的那个信息太长了,而且压缩一个多模态的信号不是一个压缩,像有压缩一个文本一样自然的事啊。我们的harness大家想我们的harness就是里面context里面可以灌很多种文本,你可以超过100万token以后启用一个压缩,但是大家设想啊,如果它塞满了一个100万token的图呢,看起来很多啊,但是其实你想压缩它可不容易啊。对你可能就即即便是你是做了很多摘要,那么这个压缩率也是非常有限的啊。 00:09:59 最本质的最对,当然这个这只是呃这个是是把问题变严重的一个东西, 00:10:06 但是更本质的一个问题就是呃我们仅靠通过这种所谓的外部记忆,真的能让我们的智能体本身产生外部演化, 00:10:15 就像一个。不断的呃就是学生他很会记笔记,他把什么东西都记下来,而且每隔一段时间记一下笔记。但假如说他的脑子,比如说他的他的海马体,他有那个我们叫那个就是记某 种记忆障碍,他无法再记忆新的东西,它仅靠外部这些记忆它能够取得很长。对这肯定是不可以的哈对,嗯,所以说呢,就是呃,我们说下一代就就是就叫做这种自主学习啊,他首先他要攻克的肯定是还是要从他的原生机制上要去解决这个呃,就是学习的问题啊。 00:10:51 对,因这个说起来比较长,我想概括一下我对这个问题的理解, 00:10:55 就是说我们核心要解决三大问题,就第一个就是叫做怎么学,就是叫怎么学,也就是说叫online learning问题啊,就是就是核心要解决怎么样在在线学习的问题,第2个节点是你要解决学什么。就是学什么,也就是说所谓的探索就是好奇心,关于是建模的问题,我需要我不能再靠呃人就是我给你一个task,给你一个任务,而是要自己的去自主的探索空间,叫所谓的学什么问题。 00:11:26 第三件事要怎么学得高效,就是efficient的问题。这个其实就是我认为它的出路就是世界模型,就是说因为很多高效性问题,它原我我跟自然的交互,就是周围环境的交互,它永远是有限的。像一辈子人一辈子其实也没有摸过多少,呃,就是跟周围世界做的上的交互,但是他是学得很快,这是因为人脑拥有世界模型,他在人人脑中仿真做了这些东西。对,而从当下来看呢,最值得投入也是最值得,呃,就是我觉得可能在短期内就有一个重大成果的,其实就是online learning力,就是在线学习, 00:12:03 因为它是其他两个的前提,你不解决怎么学,你解决了那个探索性和解决了建模的问题,你可能还是无法验证。而为了解决。 00:12:12 就online learning呢,这里面又有两个核心的问题需要解决。 00:12:15 第一个就是关于叫层次化记忆的建模啊,对,我们知道今天的Transformer它建模人的短期记忆非常优秀啊,但是对于很多交互性问题,我需要建模瞬时记忆就是感知记忆,这个是没有的啊。对,这是往短了说,往长了说就是长程记忆, 00:12:33 长程记忆可能又分为这个absolute memory,就是和这个呃和我们的semantic memory啊,它其实对应了我们的fast weight和slow weight这两套机制啊。而今天的Transformer啊,众所周知它的上下文