您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [腾讯]:协同进化:2026人工智能十大趋势报告 - 发现报告

协同进化:2026人工智能十大趋势报告

信息技术 2026-07-13 腾讯 苏吃吃
报告封面

2026人工智能十大趋势报告 编委会 人工智能正在从单点突破走向系统性进化。模型在使用中持续学习,环境在交互中被重塑,商业在落地中寻找真实价值,组织在协作中摸索新形态——四条线索彼此咬合,构成一幅协同进化的全景。 顾问司晓 | 腾讯副总裁 腾讯研究院院长袁晓辉 | 腾讯研究院副院长 资深专家 研究团队李瑞龙陈东明茹炳晟刘莫闲余一曹士圯翁金塔白惠天王强吴朋阳王鹏黄浩 CONTENTS目录 进化PartI 学习、感知和发现 趋势07智力即服务:Token 退居幕后,智力走上前台趋势08智联网:互联网的新主体,当Agent开始上网趋势09液态组织:组织开始流动,从固态结构走向液态编排趋势10角色重构:从监督者到架构师,职业的重心在往上移30354146 过去三年,基础模型进步的默认逻辑是“Scaling”:更多数据、更大参数、更多GPU。2026年大模型能力仍在持续提升,甚至没有人明确看到天花板。但随着时间拉长,有一个问题开始浮现:模型智商提高之后,要真正为人类所用,模型必须学会coding和数学之外的更多事。正如谷歌DeepMind的科学家Hassabis所说,Scaling时代远没有结束,但仅靠Scaling已经不够了,AGI的实现还需要一两项重大创新才能真正突破。 新东西究竟是什么?远期或许在于架构的创新,继续刷新智能前沿。但在2026年,我们认为是三条同时发生的学习曲线。这也许是在下一代颠覆性架构来临之前,进一步最大化基础模型应用的工作。模型的进化不再只发生在训练阶段,部署之后还在学,使用过程中还在长,研究本身也在被AI加速。 证明,纯靠程序反馈做强化学习,推理能力就能自己涌现,不需要监督微调。优势在于绕开人工标注,自主产生高质量训练信号,模型在不断试错中变强。代码和数学最先被突破,因为验证信号最容易获得。问题是这件事并不自然发生在所有领域。代码幂律曲线已开始递减,材料科学、超导体发现等方向远未饱和。RLVR正从接近天花板的领域,向这些空白地带扩散。 为什么之前扩不出去?Anthropic在一项研究中提出了相关的思考。设想一下,让AI在生物数据基础设施中导航,就像在汽车发明之前设计的意大利山城里开车,街道虽美,但现代车辆根本开不进去。代码领域最先被突破,一方面是因为答案容易验证,另一方面整个软件基础设施天生为程序化访问而建。但生物学、材料科学、临床医学,大量关键数据被困在手动网页流程和分散数据库里,模型触达不到。障碍正在被清除。一个病毒学领域的实验(VirBench,120个真实查询)显示:只要加一个确定性检索工具层,所有模型准确率都超过90%,最好达99.7%。换句话说,基础设施质量对结果的影响甚至大于模型能力本身,铺好数据访问的路,模型自然跑得通。这件事的产业含义在当下值得重视:如果基建质量的权重高于模型能力,那么科学AI的话语权就会部分从模型公司,转移到那些握有领域数据通路的机构。谁控制数据进出的闸门,谁就掌握了RLVR下一波扩散的入场券。模型不再是唯一的护城河。 在线进化:进化不止于训练,模型部署后的再学习 强化学习走出代码和数学,向更多可验证领域扩散 李瑞龙黄浩作者: 过去两年训练范式最大的变化发生在反馈方式上。以前是RLHF,让人类标注员判断哪个回答更好;现在是RLVR,让程序直接验证答案对不对。OpenAI的o系列和DeepSeek-R1先后 看你刚发的新文档。基于此,团队提出了一个务实的判断:大模型最终需要服务于人类,需要应用于各类生活、工作的上下文场景。2024年的主旋律是Scaling,2025年是Reasoning,2026年是Context Learning。而更远的战场应该是让模型学到的东西能够持久化,是Memory Consolidation(记忆巩固),否则清空窗口就全忘了,何谈持续进步?模型将从一次成型的产品,变成一个会随你长期共同进化的个体。 把上下文压缩进权重,腾讯混元的HY-WU(无相)则训练参数生成器直接按条件生成个性化权重,都在探索让模型根据场景实时 换 脑 。 后 者 让 学 到 的 东 西 能 跨 会 话 留 存 : 腾 讯 混 元 的H y - M e m o r y 为 A g e n t 设 计 了 六 层 记 忆 架 构 和 演 化 链 , 在LongMemEval基准上得分85.2远超同类,记忆条数仅为同类1/3但信息密度高出3-4倍。两条线加上CL-bench对上下文学习能力的度量,构成一个完整的在线进化技术栈:度量、适应与持久化,AI在全人类的使用与反馈下变强。 技术路径上,推理时变身和记忆巩固两条线正在同时推进。前者让模型权重不再静态:比如,NVIDIA的TTT-E2E在推理时 趋势终点从一次成型的产品与你长期共同进化的个体 更多专业领域的天花板仍待攻破。一方面是各专业领域的数据基建还停留在上个阶段,真正值钱的领域数据还锁在国家实验室、学术机构和半导体工厂里。验证本身没问题,基础设施还停在马车时代。谁先铺好程序化访问的公路,谁就先拿到RLVR的燃料。另一方面,某些领域的适用性还有待探索。ARC-AGI-2基 准 上 , 前 沿 模 型 实 现 了 四 个 月 内 从 5 3 % 冲 到 了 9 8 % ; 但ARC-AGI-3一经推出(交互式、不给说明书),所有模型又被打回不到1%,人类照样能拿到100%。在规则明确、可验证的领域里,推理能力正在快速逼近甚至超越人类;但面对开放式、需求模糊的真实情境,差距依然很大。面对ARC-AGI-3时模型效果的崩塌不是更多训练就能补上的,它标记的可能是RLVR这条路本身的边界,可验证奖励只能适用于有标准答案的任务,而开放式情境恰恰是答案需要被定义、而非被验证的地方。这意味着这条路在2026-2027还会撞上另一道软墙:可验证领域逐个被攻克,但越过去仍然需要验证一种“验证不出来的能力”的新范式。这道墙在哪一年撞上,是判断Scaling之后下一次架构创新何时到来的最好观测点。 模型越用越懂场景,最强不再等于最大 前沿模型会越来越聪明,但那不一定是大部分人用得上的模型。处理日常工作事务的用户规模,可能是前沿模型用户的十倍,比如我们生活中看到各种work工具,就比code工具,规模要高一个数量级。对这些人来说,大模型需要在日常应用中持续变强。 在生成式AI高速发展这几年,行业长期有个隐含假设,认为最强的模型一定是最大的模型,而2026年的事实正在动摇这一判断。腾讯首席AI科学家姚顺雨主持的CL-bench实验提出了一个行业不太愿意面对的事实:当前的前沿大模型,其实并不擅长从上下文学东西。实验设计大致如下,尝试全部采用虚构内容(编造星际法律、假SDK之类)防止模型背答案,来让模型执行。结果发现,哪怕信息明明摆在上下文里,最强模型的任务解决率也就17%出头。模型倾向于用自己预训练时记住的老办法,无视眼前的新规则。这就像一个固执的老员工,宁可按老流程走,也不 往更早预示范式转向。在这个过程中,参数规模让位于场景中持续进化的能力。利用Context Learning的结构性优势,让AI从场景中实时学习,就不需要把所有知识预训练进去,而是用更小的激活参数覆盖更大的能力范围。对普通用户、work用户来说,AI正在从极其聪明但不认识你的陌生人,变成越用越懂你的伙伴。在千行百业与个人消费者里,AI比拼的焦点已经从谁的模型更大转向谁先让模型真正读懂此时此刻的用户。 再具体一点,产业侧将会如何推进落地?首先需要明确一下,这里的实用性模型指腾讯混元HY3这类云端模型,跟手机上跑的端侧小模型两回事。HY3采用MoE架构,295B总参、21B激活、256K上下文、开源。设计思路是比谁用得好,不是比谁参数更大:在成本相对可控的参数规模下,通过MoE架构,在自建CL-bench专测上下文学习能力,让推理效率提升40%,成功率99.99%以上,可稳定跑完495步Agent工作流。CL-bench这类能力基准的出现代表评测标准的迁移,评测标准比模型发布往 回到开头,2026年是AI落地应用的元年,仅靠Scaling不能满足所有需求,更重要的是学习方式的多样性。强化学习拓展能力边界、从使用场景中实时学习、AI加速自身研究。模型的未来需要在反馈中迭代进化,从训练一次定型,走向与场景共生进化。我们可以设置三个锚点,12个月后回来验证:第一,RL驱动的推理是否在3个以上非代码领域产出规模商业产品;第二,实用性模型是否在多数企业场景成为默认选择;第三,OpenAI和Anthropic递归自我改进比多数机构准备好的更早到来的这些预测兑现了没有。总的来说,基础模型正在从训练一次、固定部署走向在线进化。算力和参数之外,真正稀缺的是为进化设定方向的能力。 AI加速AI研究,自我进化的引擎开始换挡 一些数据其实可以让我们大致的感受到AI参与自身研发已经走到了什么程度。Anthropic今年6月披露:合并到生产环境的代码超过80%由Claude编写;训练代码优化能力一年内从3倍跃升到52倍;在一次端到端研究实验中,Claudeagents用800小时恢复了97%的性能差距,同一任务两个人类研究员干了一周才恢复23%。 OpenAI在更早的时间,提出过一条明确的时间线:2026年9月前达到“实习生级研究员”、2028年3月前造出能独立做完科研项目的AI。其首席科学家Pachocki今年4月澄清了核心瓶颈:智力水平已经够了,卡在持续自主性上。AI能解决高级问题,但仅限短暂爆发;区分实习生和独立自主研究员的关键变量是能连续可靠工作多长时间。 Google DeepMind没有承诺时间线,但其实也已经在实打实在用AI加速研究。比如,AlphaEvolve以大模型为变异引擎,对算法源代码做大规模变异、评估和筛选,在远超人工穷举能力的设计空间中自主找到更优解。在生产环境跑了一年,恢复Google全球0.7%计算资源,FlashAttention加速32.5%,超越困扰数学家300年的11维亲吻数问题。AlphaEvolve的哲学略有不同,它绕开人类研究者的工作方式,直接在人类不可能穷举的空间里暴力搜索,只要能自动验证结果,这条路就走得通。 在AI加速AI研究这个方向上,三家在一件事上趋于一致,承认即现阶段仍是渐进过程。但是,窗口可能比预想的更短。Anthropic的判断最具代表性:递归自我改进尚未到来,也并非不可避免,但它可能比大多数机构准备好的时间更早到来。为什么还没到?核心瓶颈在持续自主性,“研究实习生”和“自主研究员”之间的真正鸿沟在于能连续可靠工作多长时间。目前AI可靠完成的任务时长每4个月翻倍,2024年是4分钟任务,2026年是16小时,但距离数周级别的持续自主研究还有距离。人类当前的比较优势是研究品味:选什么问题重要、信什么结果、什么时候该换方向。同时,递归自我改进也存在诸多问题,例如对齐成本随迭代轮次快速上升,导致中断等等。但是,逐渐加速的趋势是确定的。在可验证的执行层,写代码、跑实验、优化算法,AI已在系统性超越人类工程师。定义什么问题值得解决、判断什么时候该换方向,目前还无法被验证器程序化,因此尚未被AI通过搜索学会。但边界已经在松动。 陈东明茹炳晟作者: 严谨实验表明,纯视频生成模型在训练分布内可以完美模拟物理运动,一旦遇到未见过的条件组合,误差会高出一个数量级。利用大规模的数据可以逼近分布内的模仿,却无法外推到未知的物理条件。 原生多模态架构:缝合模态裂缝,催生视觉推理涌现 2026年,多模态AI的角色正在发生位移。过去两年,行业主线是看起来“更逼真”,现在变化已不止于画质。生成系统开始表现出理解意图、规划步骤、自主迭代的能力,生成行为本身从一次性输出变成了多步决策过程。 GPT Image 2放弃了 DALL·E 的命名,图像生成从“扩散模型外挂语言模型”的拼接模式转向原生多模态架构。视频领域走得更远:可灵Kling 3.0已将智能分镜做成原生功能,用户写的是镜头列表而非提示词。交互模