郭建元,郝志伟,王成成,范程,罗挺章,李红光,高颖,梅合肥,彭建坤,徐荣健,董敏静,吴汉,郑梦雨,韩凯,王石琪,徐长,王云和 摘要基于大型语言模型的智能体标志着从被动问答向主动任务完成的转变:它们感知环境、调用工具、维持状态,并在长远范围内采取行动。随着智能体系统从提示工程发展到工作流、上下文工程、利用工程以及具有协同进化的智能体原生训练,一个核心问题变得越来越重要:智能体性能的瓶颈在哪里——是在基础模型,还是在执行利用(harness),抑或是它们之间的耦合?本调查通过模型-利用(harness)的视角来审视基于大型语言模型的智能体。我们首先明确了智能体的功能定义以及基于大型语言模型的智能体作为与执行利用耦合的基础模型的实现视图。然后,我们分析了以模型为中心的扩展(scaling)的局限性,追溯了智能体工程的四种范式,并将执行利用分解为六个耦合的运行时职责:观察、上下文、控制、行动、状态以及验证/治理。利用这种分解,我们将任务属性和领域压力映射到利用(harness)配置,回顾了基准和评估实践,并综合了关于运行时设计如何影响长期任务完成、效率和可靠性的模型-利用(harness)证据。最后,我们确定了价值感知评估、安全、利用(harness)泛化以及模型-利用(harness)协同进化方面的开放性挑战。本调查认为,与其将智能体视为带有辅助工具的模型,不如说智能体质量——包括成功、效率、安全和泛化能力——源于模型能力、运行时基础设施、任务结构和评估设计之间的交互。本调查中讨论的一组论文已提供在很抱歉,我无法直接访问外部链接,包括您提供的GitHub链接。因此,我无法直接翻译该链接上的内容。如果您能提供具体的英文文本,我将很乐意为您翻译成中文。请将您想要翻译的英文文本复制粘贴到这里,我将为您提供准确的中文翻译。. —基于大型语言模型的智能体、利用工程、提示工程、模型与利用协同进化、评估基准索引词 1 简介 确定性能瓶颈所在。对于问答(QA),模型正逐步改进。i.e能力——例如更大的参数、更多的训练数据或更好的对齐— —通常能带来直接且可预测的提升。然而,衡量此类能力的传统基准,包括MMLU[12], GPQA [13], 以及 HumanEval [14], 边缘领域已日益饱和,污染风险进一步增加了解读的复杂性;更严格的评估,例如人类最后的考试[15已被提出用以恢复区分能力。更关键的是,当评估从封闭式问答转向交互式多步骤任务完成时,即便是前沿模型也暴露出显著的可靠性差距——SWE-bench [16], 我们-竞技场 [17], 操作系统世界 [18代理公司19], 以及终端台 [20所有这些都表明,自主性任务仍有巨大的发展空间。静态基准(已接近饱和)与自主性基准(远未解决)之间的这种差异引发了一个自然的问题:如果仅仅依靠模型扩展并不能缩小自主性任务上的差距,那么还有什么能行得通呢? 若将任务分解为小份,便没有什么特别难。— 亨利·福特 arXiv:2606.20683v1 [cs.AI] 2026年6月14日ARGE基于语言模型(LLM)的智能体——能够感知环境、推理目标并执行多步操作的自主系统——标志着从被动问答向1], [2从被动到主动任务完成3], [4与早期优化单轮回复质量的聊天界面不同,现代智能体系统如同闭合的循环,在较长的时间跨度内调用工具、更新状态并验证结果。其杰出的实例涵盖多个领域:例如编码智能体Devin[5], 克劳德代码 [6], 以及 Codex[7独立诊断和解决整个存储库中的软件工程任务;像Manus这样的通用代理8从研究到数据分析,统筹多步骤工作流程;开源平台包括AutoGPT9], 开放双手 [10], 以及 OpenClaw [11提供可扩展的框架,用于构建自定义代理管道。 这幅景象展示了一种更广泛的转变,即从对话能力转向操作能力,以及 1.1 扭力杆设计作为性能提升手段 越来越多的研究表明,代理人的表现不仅越来越多地受到模型原始推理能力的限制执行套具力量,也由其设计决定。运行时基础设施塑造着模型 感知什么、如何行动,以及其错误是否被检测和恢复。界面设计的重要性这一观点最初由SWE-agent通过实证证明。21],这表明重新设计代理-计算机界面(ACI)可以在固定条件下显著提高SWE-bench性能 渐进式技能披露34], [35评估标准也随之改变:问题不再仅仅是判断单个答案是否正确,而是判断所组装的上下文是否能让模型完成多步任务。然而,上下文工程本质上仍然是前馈的:它优化的是推理每一步的输入,但它不提供任何检测漂移、验证中间结果或从错误中恢复的结构机制。 基础型号。这一更广泛的概念随后变得清晰。Harness engineering在“术语”下定义由桥本[所]22] 模型加载数据集并且 OpenAI 7],将代理定义为,并识别出观察塑造、动作空间设计、执行沙箱化、上下文管理和验证循环为其核心组成部分。最近,NLAH [23形式化地利用逻辑作为可编辑、便携的自然语言工件,以及Meta-Harness24]将拖索配置视为一个可优化的搜索空间。 第三阶段:利用工程闭环。除了构建合适的语境,该框架引入了反馈驱动的执行:模型采取行动,观察环境响应,并基于观察结果进行推理以决定其下一步[36更广泛地说,利用工程将整个运行时基础设施视为主要设计对象。7], [22], 负责执行沙盒化、状态检查点、验证循环、错误恢复和子代理协调要什么词尾-tion通常翻译为“...行动/行为”或“...过程/状 遵循这一思路,我们采用以 harness 为中心的视角作为统一的分析框架:我们系统地考察运行时基础设施的设计,而非仅仅模型能力本身,如何决定了智能体的可靠性、效率和泛化能力。我们进一步论证,这一视角现在超越单一模型支架近期系统25将连接件视为跨多个模型的组合运行时,并日益将其视为一个可学习的对象,其路由、编排和验证策略本身也可以被优化。 态”,具体取决于上下文。例如:23], [24]. 政策性问题从向模型展示如何使整个系统保持正轨to:防止漂移,保持稳定执行,并从错误中恢复。 1.2 四种智能体工程范式 在此阶段,进一步的转变已经可见。固定Harness design typically wraps a基于手工设计或搜索 生成的运行时策略的基础模型。更新多模型 harness系统趋向于运行时路由、委派并组合用于规划 我们通过四个范式的进化视角来组织近期文献。每一范式都是为了解决其前身所暴露的局限性;每一范式都突显了不同的绩效杠杆。 、工具使用、验证、编码和特定领域子任务的多模型37]–[39与此同时,本身的安全带也是可学习的来临可编辑、搜索或优化为一级工件,包括托管模块 、编排逻辑和运行时策略。23], [24], [40这改变了什么是代理系统的标准。一个包含单个模型的单一提示仍然可以作为轻量级代理运行,但可靠的长时程任务完成越来越依赖于一种跨多模型的可优化运行时架构不仅在于提示词的巧妙运用。 第一阶段:提示工程优化发送给模型的单轮指令。例如少样本示例等技术[1], 思维链推理 [26], 自洽性[27], 以及思维树搜索[28它可以明确任务、约束输出格式,并引出模型的潜在能力。然而,提示方法从根本上解决了表达an问题:如何提问。它并没有解决 信息问题:仅靠提示是无法的提供缺失知识、动态管理不断变 化的状态,或在长动作序列中保持连贯性。 第二阶段:工作流与上下文工程将优化单元从单个提示转移到围绕多步执行的信息生命周期。其核心在于... 第四阶段:代理-本地化训练与协同进化建立在上述可学习多模型 harness 视图之上。它的 内化第一个方向是通过交互环境,计划、工具使用、验证和恢复等自主行为正越来越多地训练到模型参数中。41]–[44其第二个方向是协同进化过度部署,该模型,利用,和 what克制力是在策展信息进入模型 when以何种形式上下文窗口,并且[29],包含检索增强 生成[30长期记忆管理31], 工具和 API 定义 [32], [33], 表1:与我们工作相比的代表先前调查的比较。“Broad”表示涵盖通用的基于LLM的代理领域,而不是特定子领域;“Eval.”表示明确涵盖基准测试和方法评估;“App.”表示对应用领域和使用案例的广泛讨论;而“Industry”表示一项调查在其主要分析中纳入从业者报告、生产系统或工业工程证据的程度。 改进循环可能都可以从执行轨迹中更新,这些轨迹指示了要保留、更改或撤销的内容。40], [44]–[46这并非消除了框架;它将设计问题转向了模型中代理行为有多少是学习到的,有多少保留在运行时,以及整个技术栈如何安全地随时间改进,从而开辟了一条通往...的道路。自进化智能体系统. 将其应用于生态覆盖和生产力。等设计原则。宁.[?从以代码为中心的视角来组织该领域, 将可执行程序视为推理、行动、状态和验证的基础。这些调查提供了有价值的 harness 分类法、目录或特定于基础层的路线图。 与近期聚焦于评估工具(harness)的调查相比,我们的贡献并非主要是另一层分类体系或项目目录。相反,我们探讨的是主导性的工程瓶颈如何在提示优化、上下文/工作流组织、组合式及可学习运行时、以及智能体-原生协同进化等过程中迁移,以及这种迁移应如何通过实证方法进行评估。据此,我们将评估工具(harness)的结构与任务压力特征联系起来(第X节)。6), 基准证据(第几节)7),以及基于价值感知的部署目标(第几节)8),而不是仅仅以分类体系的完整性或存储库编码为中心进行分析。 这四个阶段构成一个概念演进视角,而非严格的时间划分;在实践中,它们四者共存于当下。我们的目标并非引入另一个成分分类法,而是要运用这一演进过程和基准证据(第几节)。7)以分析主导性能瓶颈如何跨越阶段移动,以及为何 Harness 设计已成为智能体工程的核心对象。 1.3 与先前调查的关系 近期调查已记录了基于LLM的代理的迅速崛起,但大多数研究是通过面向分类学的视角来组织该领域的。表1将我们的调查与有代表性的先前工作进行比较。通用型调查总结了智能体架构和组件,例如记忆、规划、行动、感知、应用、安全性和评估。3], [4], [47多智能体调查侧重于沟通、协调、协作结构和流程组织。48]–[50其他调查则考察更狭窄但同样重要的领域,包括评估方法[。]51], 图形用户界面/计算机使用代理[52[] 具体系统53],以及值得信赖的代理人[54自2026年初以来,已有几项研究将焦点具体缩小到等代理利用。孟。55将此装置正式定为 我们的调查明确了三个区别。首先,它是进化优先我们围绕工程范式转变来组织文献,而不是围绕静态的 组件分类。 以 harness 为中心其次,它是我们将执行吊索视为一种管理观察、背景、控制、行动、状态、验证、恢复等要素的一流技术对象。 学术证据与工业效率。第三,它连接。实践利用基准测试结果、开源系统、工程报告以及受控的模型- harness 分析,考察运行时设计选择如何影响代理的可靠性、成本和延迟。 等六元组。李。56进一步提出七层ETCLOVG分类法,并绘制一个大型开源 简而言之,我们的目标不仅是编目基于LLM的智能体,还要解释为何 harness 工程成为核心系统关注点,以及它如何延伸至未来的智能体原生训练与共同进化。 1.4 范围边界 本调查涵盖2020年至2026年的基于大语言模型(LLM)的智能体系统,包括提示方法、工作流框架、 harness 和运行时设计、多模型编排、智能体原生训练、模型与 harness 协同进化、领域部署以及评估方法。我们关注那些一个或多个 LLM 作为认知引擎运行在执行 harness 内的系统,并综合分析了已发表的论文、公开的工程报告、基准测试以及受控的模型与 harness 对比结果。我们优先考虑那些能直接为智能体系统设计、效率或评估提供信息的高影响且可验证的来源。