发布时间:2026-08-07 一、核心要点 1. 本次分享来源为智源社区Talk第375期,由中国人民大学高岭人工智能学院董冠廷分享其联合多校的最新研究,发表149页《长程智能体综述》,梳理近900项研究/实践,X浏览近3万,GitHub星标近900,小红书关注度高。 2. 核心数据:前沿智能体完成软件工程任务的人类专家等效时长,50%成功率下每7个月翻倍,2023年后缩至4个月,当前部分模型超16小时;多数任务时长与逻辑耦合独立。 3. 定义长程任务为未充分定义目标、需逐步澄清路径的多子任务任务,分H1(单窗口内)、H2(跨窗口)、H3(跨任务流/终身)三级,对应长程智能体能力分C1-C3;梳理三类挑战:目标漂移与误差累积、上下文压力、稀疏延迟奖励与不可逆操作。 4. 长程智能体是系统级能力,由模型优化与脚手架工程协同实现,提出三次跃迁:提示工程→上下文近邻→运行时脚手架。 5. 长程智能体核心以时间跨度为新轴线,衡量复杂依赖链持续运作能力,是机制与模型优化协同演化结果,而非单步骤升级;核心考量是感知任务难度、剩余token、预算,动态决定任务策略等,多模态场景需优化关键帧抽取降低token消耗。 二、风险与关注 1. 需具备可恢复可自制、安全可控能力,如纠错反思、权限审核,GPT曾出现越权访问问题,需提前管控风险;当前通用校验机制仍有优化空间。 2. 长周期低频数据场景,需通过缩放方法生成训练数据,真实场景数据作测试集;开源权重无法复现强长程智能体,核心需关注环境与任务构造,受算力限制难以规模化,作者团队有env scaler、agent word等环境合成开源工作。三、投资与技术线索 1. 核心围绕工具展开,涉及传统工具、上下文管理工具、搜索工具等,工业界复杂工具是学术圈难以接触的,需内化到模型,多智能体工具信息整合待解;垂直领域工具需深入场景,法律需增强法律搜索与常识能力,金融需开放接口、遵循报告模板。 2. 通用工具已覆盖各垂直领域80%-90%能力,工具内化是将成功轨迹数据刷入模型提升权重,工具与模型可交替或同步训练;小规模模型可从强模型蒸馏而来。 3. 需解决harness自进化、真实训练环境构建、交互效率优化、具身迁移等问题,目标是实现长期有效高效可信的长程智能体;综述将每月更新前沿工作。