— —A I研 发 自 动 化 加 速 下 的 模 型 、 算 力 与 应 用 机 会 行业研究·专题报告 传媒·计算机 投资评级:优于大市(维持) 证券分析师:陈瑶蓉021-61761058chenyaorong@guosen.com.cnS0980523100001 证券分析师:张衡021-60875160zhangheng2@guosen.com.cnS0980517060002 证券分析师:熊莉021-61761067xiongli@guosen.com.cnS0980519030002 核心要点:RSI重构模型生态,关注头部模型厂商、算力硬件及CSP与高价值应用场景 ➢自动化AI研发加速,RSI正由理论进入落地前夕的阶段。1)虽然完整RSI尚未实现,但AI已经进入代码编写、研究调试、Kernel优化、自动实验和部分后训练环节,局部研发反馈闭环正在形成。2)从当前前沿模型厂商落地来看,模型、Agent、Evaluator、训练平台和算力基础设施开始被整合进同一套研发系统和工作流,AI逐步由研发辅助工具转向研发流程的重要参与者和工具。3)从技术和产业落地来看,当前虽然暂时无法判断RSI实现的确切时点,但是从渐进落地的角度来看,RSI正处于持续演进渗透的阶段。 ➢前沿模型厂商:模型竞争由单代能力比拼转向AI Research Factory竞争,研发正反馈与平台化壁垒有望强化。1)从模型竞争来看,能力更强的模型既是争取客户的重要因素,同时也正逐渐成为研发下一代模型的生产工具;远期来看,模型能力如果能够持续提高Research Agent和研究人员产出,领先厂商可能形成“更强模型—更高研发效率—更快推出继任模型”的正反馈闭环。2)模型厂商竞争要素也将由人才、数据和单次训练,扩展至模型、Agent、Evaluator、数据闭环、训练平台和算力的系统能力。3)综合各方竞争要素,具备基础模型、云基础设施、Agent平台、企业客户及真实任务反馈的厂商,更有机会将技术领先转化为API调用、订阅收入、商业化和平台生态。 ➢算力基础设施:训练与Research Inference共同扩张,AI研发自动化有望进一步打开算力产业链需求空间。1)训练端来看,算力需求不再仅取决于单次前沿预训练规模,RSI落地渗透之下,参数规模、训练Token、模型代际频率、候选实验、Post-training、RL Rollout、验证及研发推理均可能同步增加,更快迭代和更高实验并行度可能形成对训练需求的乘数效应,带动算力需求的天花板持续提升。2)重点关注计算芯片及ASIC、HBM与存储、先进封装、高速互联与光通信、交换设备、液冷、电力及数据中心等供给壁垒较高的基础设施环节;3)同时看好具备大规模算力基础设施和持续资本开支能力的头部CSP。随着训练、Research Inference及Agent推理负载同步增长,算力需求将由单次模型训练向持续研发与推理扩散;具备GPU集群、自研ASIC、云平台和模型服务能力的CSP,有望同时受益于AI资本开支扩张和云端AI调用量提升。 ➢高价值应用:模型能力加速通过MaaS、API与Agent平台向应用端外溢,优先关注可验证、可闭环的高价值场景。1)模型能力持续提升、推理成本下降以及多模型接入门槛降低,将持续降低AI应用开发、试错和规模部署成本,并通过需求弹性提升调用频次、上下文长度和任务复杂度从而促进应用场景的扩展与渗透率提升。2)软件工程、研发工具、企业知识管理、客户服务和数字内容等领域数字化程度高、结果可衡量、反馈周期短,有望率先形成Agent规模化渗透;药物、材料和芯片设计等研发场景亦具备较大的效率提升潜力。3)应用公司的核心壁垒将由“能否接入模型”转向专有数据、核心工作流、可靠Evaluator以及持续提高客户产出的能力。 ➢风险提示:完整RSI可能长期无法形成;商业化落地低于预期风险;竞争加剧风险;监管政策风险;技术进步低于预期风险等; 目录 R S I:A I开 始 参 与 生 产 下 一 代A I01从 理 论 推 演 到 工 程 实 践 :R S I的6 0年 演 进 与 当 前 拐 点02产 业 影 响 与 投 资 观 点 :A I研 发 加 速 下 的 模 型 、 算 力 与 应 用 机 会05前沿模型厂商的RSI路径:从研发提效到继任模型闭环04从自动化AI研发走向RSI:现实进展与远期路径03 1. RSI:AI开始参与生产下一代AI 1.1 RSI的核心理念:持续提升“开发AI的能力” ➢RSI(Recursive Self-Improvement,递归自我改进)是指AI系统参与设计、开发和训练更强的继任系统,而能力更强的继任系统又进一步提高AI研发能力,形成跨代持续的正反馈: ➢更强的AI →更强的AI研发能力→更快开发出更强的继任AI → AI研发能力进一步增强 ➢RSI与普通模型升级的根本区别,不在于AI是否参与了代码编写、实验执行或训练优化,而在于“开发AI的能力”本身是否成为持续改进的对象。如果当前模型只是提高了单次任务的开发效率,属于AI辅助或自动化AI研发;只有当其开发出的继任模型能力更强、继任模型又能进一步提高下一代AI的研发效率,并且这一过程能够跨越多代持续发生时,才构成严格意义上的RSI。➢RSI中的“Self”指的是当前模型通过Research Agent、Evaluator、训练平台和实验系统参与下一代模型研发,再由下一代模型继续改进整套AI研发系统。模型既是研发的成果,也逐渐成为生产下一代模型的生产工具。因此RSI的关键不是“AI能够改进AI”,而是这套系统能否跨代、持续地提高AI自身的研发能力。 1.2 RSI的边界:当前多数“自我改进”仍未进入继任模型闭环 ➢Self-refinement、Self-play和Coding Agent都不等于真正的RSI。模型检查并修改自己的结论、通过Self-play产生训练数据、利用强化学习提高特定能力,或让Agent积累Memory、Skill和Workflow,都可以改善当前系统的表现;但这些改进的对象仍主要是当次任务、当前模型或模型外部的执行系统,尚未进入“研发下一代AI”的跨代循环 ➢Self-refinement改进的是当次任务输出。模型生成答案后进行自我反馈和迭代修改,通常不改变模型参数,更不涉及继任AI研发。 ➢Self-play、自训练和强化学习可以提高模型在特定任务上的能力。AlphaGo Zero通过自我对弈产生训练信号并持续变强,证明局部自我学习闭环能够成立,但系统并没有因此获得开发下一代通用AI的能力。 ➢Agent改进主要发生在模型外部系统。Agent可以积累记忆、工具、Skill和工作流,使后续任务执行得更好,但改进对象仍是任务执行方式,而非AI研发能力本身。 ➢AI辅助或自动化AI研发开始进入代码编写、Debug、实验执行、结果分析和训练优化等环节,是通向RSI最重要的现实路径;但只要研究方向、关键判断和继任模型开发仍主要由人类完成,就不能证明递归已经闭环。 ➢只有当AI能够开发更强的继任系统,且继任系统又进一步提升AI研发能力,并使这一正反馈跨越多代持续发生时,才构成严格意义上的RSI。根据Anthropic的官方Blog,当前Claude已经开始加速AI研发,但尚未达到能够完整、自主开发继任系统的RSI状态 1.3当前阶段:完整RSI尚未实现,AI研发自动化持续深化 ➢AI参与AI研发已经进入多个真实场景。OpenAI披露,GPT-5.6已被内部研究人员用于诊断研发故障、优化训练系统、运行机器学习实验和分析结果,并建立了一组基于真实AI研发任务的评测。Anthropic也披露,Claude已经能够在目标明确的任务中执行实验优化,并在部分开放式研究中自主提出假设、运行实验和迭代方案。 ➢当前进展主要体现在三个方面:AI已能承担代码、Debug、实验运行、系统优化和结果分析;在目标和评价标准明确的任务中,局部实验闭环已经可以自动运行;在AI支持下,部分研发任务的表现、实验频率和单个研究人员的产出均有明显提升 ➢但从严格定义口径看,完整RSI仍未实现: ➢自主完成前沿继任模型的完整设计、训练、验证和交付;➢研究方向选择、目标设定、评价标准和关键结果判断;➢研发能力的提高能够跨越多代持续成立,并形成稳定、可重复的递归加速 2 .从 理 论 推 演 到 工 程 实 践 :R S I的6 0年 演 进 与 当 前 拐 点 2.1 RSI的思想最早可以追溯到1965年 ➢RSI并不是伴随大模型才出现的新概念。其思想源头通常可以追溯至1965年:I. J. Good提出,如果机器设计本身也是一种智力活动,那么一台“超智能机器”就可能设计出能力更强的继任机器;由此反复迭代,最终形成能力快速上升的“智能爆炸”。Good没有使用今天的RSI术语,但已经描述了其最核心的递归正反馈机制; ➢1993年Vernor Vinge将这一讨论扩展为“技术奇点”:一旦出现超越人类的智能,技术发展轨迹可能发生难以预测的结构性变化。 ➢2003年JürgenSchmidhuber提出Gödel Machine,将自我改进推进到形式化层面:系统只有在能够证明某次代码修改有助于提高目标函数后,才执行对自身程序的重写。这表明“系统修改自身”在严格假设下可以被形式化描述,但其依赖预设公理、效用函数和可证明性,仍主要是一种理论模型 ➢2008年Stephen Omohundro进一步指出,具有稳定目标的自主系统可能产生能力提升、资源获取、自我保护等工具性倾向。RSI研究由此不再只讨论“能否自我改进”,也开始系统涉及目标稳定性、控制权和安全风险 ➢早期研究已经提出了RSI的正反馈机制、自我重写形式以及潜在安全问题,但缺少强通用模型、可靠Evaluator、自动实验平台和大规模工程环境,因而长期停留在理论推演与形式化探索阶段。当前来看相比之前最大的变化是RSI实现所需的工程条件开始逐步走向成熟。 2.2反馈闭环从封闭任务向研发流程扩展 ➢RSI的落地推进不是一蹴而就,而是反馈闭环不断扩大的过程。系统最初只能在规则明确的封闭任务中优化策略,随后开始利用自身生成的数据训练模型、反思并修正任务输出,当前则进一步进入代码实验和科研工作流。闭环覆盖范围在扩大,但距离“自主开发更强继任模型”仍有明显差距; ➢自我对弈、自生成数据、自我反思和自动化研究,都是RSI的重要前置能力。从2017年AlphaGo的策略闭环,到训练数据、任务输出,再到当前的研发流程闭环,AI能够承接的环节越来越多。但当前研究目标、实验模板、工具环境和评价标准仍主要由人类设定;AI可以执行提出想法、编写代码、运行实验和分析结果等环节,但尚未完成从研究方向到继任模型的全链条接管。 2.3完整RSI仍需时间,工程条件正逐步成熟 ➢过去的自我学习系统通常只能在特定任务中运行:模型、反馈机制、实验环境和训练流程彼此割裂,需要研发团队手工连接。最近两三年的关键变化是模型能力、Agent执行、自动验证和研发基础设施开始被纳入同一套工程系统,AI由“给出建议”逐渐转向“持续完成研发任务” ➢模型开始具备进入真实研发流程的基础能力。Reasoning和Coding能力的提升,使前沿模型不再局限于生成代码片段,而是能够理解真实代码库、修改多个文件、执行测试、分析日志并修复错误。OpenAI在2025年推出的Codex已经可以在独立云端沙箱中编写功能、修复Bug并提出Pull Request,软件工程Agent由能力展示开始转向真实工作流 ➢Agent将单轮模型能力延伸为长周期执行能力。工具调用、代码执行、长上下文、持久记忆、错误恢复和任务编排,使模型能够连续完成多个相互依赖的步骤。METR的任务时间跨度评测显示,前沿Agent能够可靠完成的任务长度正在持续扩大;Anthropic进一步展示了依靠测试Ora