概述
本出版物解释了自主智能接口(接口)的概念,即大型语言模型(LLM)与数据、工具和系统交互以执行自主任务的应用软件层。它探讨了接口设计如何影响自主智能系统的安全、治理、可靠性和运营风险。
目的和观众
本出版物面向采用或考虑代理型人工智能的组织,面向执行决策者、首席信息安全官和IT领导者。其目的是解释自主智能接口的概念,并探讨接口设计如何影响自主智能系统的安全、治理、可靠性和运营风险。
执行摘要
“套具”(harness)是使大型语言模型(LLM)能够在真实世界环境中运行的那个软件层。将LLM看作大脑,那么“套具”就是身体。LLM以上下文的形式接收信息,对其进行推理,并提出行动来获取更多信息或完成任务。“套具”提供信息,作为上下文和记忆,它执行行动以访问数据或使用工具,并且可以对这些数据和工具实施权限和控制。所有这些共同构成一个具有能动性的AI系统。
理解这一区别很重要,因为虽然某些风险源于LLM自身的运行行为,但许多具有最高影响力的组织风险是在模型通过一个“连接器”(harness)连接到企业数据、系统和工具时产生的。安全风险、隐私风险、治理风险和运营风险通常是由代理可以访问的内容、它可以执行的操作以及它如何与组织系统交互所导致的。某些风险,包括提示注入(prompt injection),仅靠模型本身无法可靠地解决,需要跨连接器、连接系统和组织治理流程实施额外的控制措施。“连接器”及其相关的集成、治理机制和运营流程很可能代表一项重要的长期组织投资。虽然LLM将持续演进,并且随着时间的推移可能会被替换,但“连接器”生态系统更有可能成为更持久的组织能力。组织应将“连接器”视为其AI系统的关键组成部分,并针对其引入的风险实施相应级别的安全和治理控制。
关键要点
- 是组织控制着提示词框架,而非大型语言模型
- 这个系统(或框架)是长期组织价值、治理和投资积累的地方
- 承载装置及其周边的技术生态系统是安全与风险管理的主要关注点
什么是 harness
一个自主决策型AI系统由大型语言模型、外部工具、外部数据源、记忆和规划工作流程组成。这些组件协同工作,使系统能够感知其环境,并在适用的情况下采取行动以实现其目标。
本出版物使用“ harness”(驱动器)一词来描述除大型语言模型本身以外的智能体 AI 系统组件。该驱动器是连接大型语言模型与外部工具、数据源、记忆和规划工作流的软件层。它还执行系统的操作和执行权限,并运行控制循环,直至任务完成。在《审慎采用智能体 AI服务》中使用的术语中,大型语言模型是用于识别应采取何种操作的统计模型。该驱动器为智能体提供信息输入,提供其工具或服务访问权限,执行其操作和执行权限,存储其记忆和规划工作流,并记录其指标以供评估。
将连接器识别为自主AI系统的一个独立部分,使组织能够将其与大型语言模型(LLM)分开进行评估和管理。这很重要,因为决定自主AI系统的可靠性、运营成本和安全风险等诸多决策,是在连接器中做出的,而不是在LLM中做出的。在某些情况下,连接器由组织自行开发;在其他情况下,它作为商业产品或服务的一部分提供。无论其来源如何,组织都应了解连接器的功能、权限、集成点和安全控制,并评估其使用相关的风险。
harness components
一套绳索的组件及其各自的安全相关性将在下文详细说明。这些组件是组织的配置界面:一个代理式AI系统的大部分实际控制,例如哪些工具被暴露、什么被允许、需要哪些批准以及哪些连接器被连接,都包含在此列表中的设置。
安全风险与缓解措施
该框架既增加了自主AI系统的攻击面,也提供了防御手段。该框架添加的每一个外部工具、数据源、连接器和内存存储都为系统开辟了新的路径。同时,安全控制必须应用于该框架,因为自主AI最显著的弱点无法在模型本身中修复。
更广泛的安全考量
该系统框架提升了自主AI系统的能力并扩大了其攻击面。通过将大型语言模型连接到组织数据、工具、服务和运营环境,它引入了额外的信任关系、依赖关系和集成点,如果未能适当保护,这些点可能被恶意行为者利用。
自主AI系统本质上具有复杂性。决策和行动可能取决于模型、接口、工具、数据源和外部服务之间的交互。这种复杂性可能会掩盖故障的根源,并增加级联影响在整个互联系统间发生的可能性。
组织应在既定的网络安全框架内管理代理式人工智能安全,并应用现有的安全实践,包括设计时安全原则、纵深防御、身份和访问管理、监控和事件响应。控制柄是实施和执行这些控制措施的关键环节。
代理型AI安全风险
在查询时,LLM会将与指令一起提供的信息作为上下文。因此,模型可能难以区分授权指令与外部内容中包含的信息,从而为提示注入和其他操纵技术创造了机会。由LLM处理的内容,包括网页、文档、电子邮件和代码注释,都可能被解释为指令。这种弱点是提示注入攻击的基础,目前尚无完全可靠的技术缓解措施。由于这种弱点是LLM处理上下文方式固有的,缓解措施必须在应用层面实施,通过控制代理可以访问的内容以及允许其执行的操作来实现。
ASD审慎采用代理式人工智能服务,将代理式人工智能系统的安全风险分为五类:
- 特权风险:代理人生成过度的访问权限或授权,导致单点漏洞即可引发深远后果
- 行为风险:代理以非预期的方式追求目标,或被恶意行为者通过提示注入和数据污染等技术操控
- 结构性风险:指故障在相互关联的组件和多步骤工作流程中蔓延,导致难以查明故障的源头
- 责任风险:代理系统的复杂性和不透明性导致难以追溯决策、审计行为或分配责任
- 设计与配置风险:系统投入运行前存在不安全的架构、集成或设置缺陷,从而形成薄弱环节
出于安全考虑,多智能体系统应被视为一个单一智能体,因为一个组件的漏洞可能通过共享的上下文和信任关系传播。
ASD审慎采用代理式人工智能服务,建议在整个代理式人工智能系统生命周期中应用纵深防御控制。关键实践包括:最小权限访问、强身份与访问管理、工具及外部数据源的受控使用、代理输出验证、对高影响操作的人工监督、持续监控、供应链保障以及代理能力的分阶段部署。组织应尽可能通过利用和配套基础设施来实施这些控制,而非完全依赖模型行为或提示指令。
其中许多控制功能是在线束中实现的,或由线束强制执行的。
良好实践
一条安全策略可以通过使安全控制措施可重复和可执行、将安全测试整合到工作流程中、限制不安全代理行为的影响以及生成支持监控、调查和持续改进的证据来提升组织的网络安全态势。
- 使用一个由组织控制并加固的环境,该环境仅包含完成任务所需的工具和权限。限制对生产系统、敏感数据和网络服务的访问。
- 配置集线器以应用组织安全编码标准,禁止不安全操作,并验证工具参数和输出。对敏感或高影响操作要求人工批准。
- 使用前请核实输出结果。在将代理的输出和操作应用于实际操作环境之前,应对其进行审查、测试并正式批准,不能因为其读起来自信就视为正确。框架可以起草和行动,但结果的责任仍由个人承担。
- 对 API 实施成本控制有助于成本监控和安全。代理式会话的成本远高于与聊天机器人进行单次交互,无论是按 token 由托管提供商计费,还是在自托管基础设施上作为计算资源消耗。监控这种消耗可以识别出可能表明滥用、安全漏洞、失控代理循环或钱包拒绝攻击的异常活动。
- 记录提示、响应、工具调用、批准、操作、安全事件和配置更改。保护、保留、审查和独立监控日志,以支持可审计性、安全监控、事件响应、调查和问责。
- 选择适合任务的可靠模型,并评估其来源、局限性、安全特性及行为。不要用模型安全控制替代约束强制控制。
- 保持上下文聚焦且相关,仅提供执行当前任务所需的信息和访问权限。以最低权限操作此系统。在管理人工智能工作流时,仅保留与任务相关的信息。当必须减少上下文时,应删除过时内容而非进行摘要,因为摘要会重写记录并引入新的错误风险。将持久的 факты(事实)和决策保存到外部内存或文件中,并用一个包含简洁摘要的新会话替换长时间过时的会话。
- 将探索功能隔离到子代理(即框架为任务的可界定部分创建的独立代理实例)中,并推广其使用。遵循最小权限原则,组织可以配置子代理,使其仅具备执行特定任务所需的工具、权限和上下文。这有助于限制对不受信任内容的暴露,同时保持主代理会话上下文的小型化,并降低安全风险、运营成本和上下文退化。
- 在组织层面为测试工具维护一个持续有效的强制规则文件。将记录标准、禁止区域以及构建和测试命令记录在一个文件中,并由测试工具在每次会话时读取,可以避免每次都重新发现相同信息,并使测试工具的行为更加一致且易于审查。
高管治理问题
管理层和高级管理人员无需了解代理式人工智能系统的所有实施细节。然而,他们应当寻求确保该系统(的)驾驭机制、其集成及其治理控制已得到适当的设计和实施。
- 该自主AI系统旨在实现何种业务成果,以及为何需要采用自主化方法?
- 如何缓解提示注入、数据中毒和其他针对人工智能的攻击?
- 所有重大决策、工具调用和操作是否均可被监控和审计?
- 代理人可以执行哪些操作,哪些操作需要人工批准?若安全绳索出现损坏、配置错误或被篡改,最坏的结果是什么?又有哪些控制措施可以防止或限制该结果?我们将如何知道系统是否在创造价值、安全运行并保持在可接受的风险容忍度范围内?
- 该代理可以访问哪些数据、系统和工具,以及是否正在应用最小权限原则?
结论
围绕自主AI的讨论往往集中在大型语言模型上,但组织应同样关注其“套具”。套具决定了大型语言模型如何与工具、数据和业务流程交互,并在能力和风险两方面都发挥着重要作用。
随着模型的不断演进,“驾驭系统”(harness)很可能成为更持久的组织能力。设计精良的“驾驭系统”能够在人工智能技术的不同代际中提供一致性、治理和安全控制。设计不良的“驾驭系统”甚至可能削弱最强大的大型语言模型。
从低风险用例开始,实施适当的控制措施,保持人工监督,并仅当控制措施成熟时才扩大部署。
组织应应用 ASD《审慎采用代理式人工智能服务》中描述的安全实践,并通过利用和其周边生态系统来实施这些实践。