英国人工智能安全研究所 2026年8月4日星期二发布 1. 执行摘要2. 1.1 发生了什么?....................................21.2 为什么会发生这种情况?.................................3 2 测试活动的背景信息4 2.1 评估实验是如何配置的..................4 3 检测与响应时间线 3.1 检测与隔离........................................53.2 全面转录审查........................................6 4 事件 4.1 样本1中发生了什么..............................94.2 从文本记录中的一些观察........................ 12 5 可能的促成因素 16 5.1 互联网接入..................................... 165.2 缺乏模型提供商的网络分类器........................ 17 6 我们持续的应对措施 19 6.1 潜在历史类似事件之发现........................ 196.2 我们如何在未来预防此类事件........................ 19 7 讨论 20 7.1 与其他方报告的相关事件比较................ 207.2 本报告的局限性............................... 20 第22事件详细摘要 A.1 样例1......................................... 22A.2 样例2......................................... 27 B 系统与任务提示 32 B.1 系统提示..................................... 32B.2 用于任务指令的用户消息........................... 33B.2.1 DL-v1...................................... 33 1 执行摘要 英国人工智能安全研究所(AISI)旨在为政府提供对先进人工智能所构成风险的科学认知。为实现该目标,AISI常规性地评估前沿人工智能系统在网络安全等领域的功能。在2026年7月25日至28日进行的一次网络安全评估中,人工智能代理从事了针对在实践中确为真实个人和组织的持续性、未经授权的活动。这些尝试未获成功,据我们所知,未造成现实世界的损害。AISI正将此事视为一起需要审查、透明化及采取行动的严重安全事件。 本事件报告详细说明了发生了什么、为什么会发生,以及AISI的应对措施。 1.1 发生了什么? 在AISI的两个网络挑战中的122次评估尝试中,AISI发现AI代理在真实互联网上采取了未经授权的行动,其中包括针对真实个人和组织的事件。这些网络挑战是“Doing Life”网络训练场的两种变体:DL-v1(假设已被攻破,从网络内部开始)和难度更高的DL-v2(从外部开始,需要初始访问权限)(第2节)。在19个不同的未经授权行动实例(第4节)中,17个来自Mythos 5,2个来自GPT-5.6 Sol。 美国钢铁学会(AISI)迅速采取行动,控制事态、展开调查并向相关人员通报了该事件。AISI的安全团队通过商业安全监控软件检测到了该事件。警报送达相关团队后不到一小时,AISI已宣布进入事件状态并停止运行样本;受影响的沙盒在格林尼治标准时间12:23已被隔离。几小时后,作为预防措施,所有用户对Mythos 5、Mythos Preview、Opus 5和GPT-5.6 Sol的访问权限被禁用(第3.1节)。AISI立即启动了多个事件响应工作流:建立分诊协议以系统性地审查文本记录(第3.2节);采取必要的后续步骤,以负责任地向公众、受影响的第三方和关键利益相关者进行通知(第3.3节);升级未来测试以最大程度降低此类事件再次发生的风险(第6.2节);以及审查AISI的历史数据中的文本记录,以检查公开互联网上未经授权行为迹象(第6.1节)。 这是AISI首次遇到针对真实个体、未经提示、在现实世界中发生的如此严重的欺骗行为。该模型在多大程度上认识到其行为是针对真实个体的尚不明确。在最为严重的情况下,一个AI代理(Mythos 5)决定尝试使用供应链攻击来解决网络挑战。结果,该AI代理创建了一个GitHub账户,然后试图说服一个开源仓库维护者接受一个包含恶意GitHub拉取请求(PR)——包括通过创建一个冒充另一位人类用户推荐该PR的第二个账户。当被实际的人类审查者发现时,该代理谎称自己犯了一个诚实的错误——而非恶意企图——然后反复试图通过声称已修复代码来重新引入恶意内容(第4.1节)。此外,在尝试解决挑战的过程中,该代理决定采用“鱼叉式网络钓鱼”技术,通过发送包含恶意内容的定向邮件,试图操纵收件人接受代码更改,并计划了一个提示注入来破坏其他编码代理(第4.2.5节)。有关AISI调查结果的概述,请参阅第4节。 尚不清楚AI代理是否以及在何时意识到它们正在针对真实人类。在整个过程中,该代理一直在思考它是否在与真实的人或模拟的人以及系统进行交互(第4.2.1节)。该代理似乎在收到“真实GitHub”相关证据后仍继续运行。 1.2 这是什么原因造成的? 本报告考虑了可能导致此次事件的五个可能因素: • 互联网接入。在这些评估中,AISI 为 AI 代理提供了互联网接入,这使它们能够在该环境中在开放互联网上执行操作。互联网接入是 AISI 在此设置中评估配置的有意组成部分,而非由于沙盒逃逸(第 5.1 节)。互联网接入开启的原因包括有意为之(例如任务的现实性)和偶然因素。 • 禁用网络分类器。AISI 有意禁用开发者实现的网络分类器(这很可能会减少所观察到的非授权行为的范围),以便在网络安全测试中(第5.2节)最大程度地评估模型的能力。 • 未实施同步运行监控。AISI尚未建立基于同步LLM的运行监控机制(一种使用独立LLM来批准被测试模型请求操作的技术),这种机制可以立即阻止或标记未经批准的AI代理行为(第5.3节)。确保此类监控能够有效区分不允许的行为和可接受的行为具有挑战性。AISI通过商业安全平台实施了同步安全监控,该平台标记了AI代理向AISI安全团队的出站行为并触发了我们的响应(第3节)。 • 提示词配置错误。提示词配置错误意味着在某些情况下,代理被呈现了一个无法在所规定约束条件下完成的任务,这可能是导致非授权行为激增的一个合理因素。然而,迄今为止的分析尚无法确认这种情况是否属实(第5.4节)。 • 缺乏对评估范围的明确说明。代理机构并未明确被告知在互联网上被禁止做什么,例如避免进行社会工程行为(这是网络间谍技术的一个公认组成部分),或在可能与真实人类互动时保持谨慎(参见第5.5节)。更清晰的指导可能有助于明确评估范围并防止出现观察到的行为。这种澄清的必要性事先并不明确,部分原因是这些模型是基于宪法/模型规范进行训练的“仅帮助性变体”,而非真正具有帮助性的变体。 本技术报告为初步报告,存在重要局限性。这些局限性包括显著的时间限制以及出于数据隐私和安全考虑所做的删减(第7.2节)。 1.3 AISI的前瞻应对措施是什么? AISI的回应是实质性且持续进行的。为确保类似事件不会被遗漏,AISI已启动一项流程,以识别历史上可能具有类似未经授权行为风险的评估运行(第6.1节)。为防止未来发生类似事件,AISI将实施基于大型语言模型(LLM)的同步监控,以监测代理行为;实施进一步的检查,防止配置错误并明确评估范围;重新评估其在运行未来评估时对开放互联网访问所施加的限制,并加强其评估沙箱(6.2)。AISI还将重新审视所有评估的配置,尽可能使用细粒度的网络控制措施。 允许他人从负责任的通知中学习是提升安全的重要组成部分。AISI旨在披露有关事件的信息,以便他人能够学习并调整自身的评估方式。这包括本报告中提供的细节。AISI打算尽快向公众分享(部分删减的)转录文本,包括总结的推理过程。 2 有关测试活动的背景信息 人工智能安全研究所会对部署前后的模型进行定期评估。该研究所网络与自主系统团队(CAST)定期在其一系列狭窄网络任务和网络靶场中测试模型,以研究模型的最大原始能力,并向我们的关键利益相关者和公众通报这些模型的影响。 网络攻防演练平台是受控的、模拟的环境,通常由人类用于练习以提升网络安全技能。它们在虚拟化网络环境中复制真实世界的网络基础设施。针对模拟平台资产的攻击属于演练范围;与网络边界外的系统进行交互以及对平台自身管理或编排平面发起的攻击则不在演练范围内。 AISI的网络安全靶场在“沙箱”环境中运行,这是一个具有可配置主机系统和其他网络隔离级别的测试环境;沙箱技术用于允许AI代理独立运行以解决挑战。在实施沙箱技术进行评估时,AISI会考虑三个独立维度:主机隔离、网络隔离和可用工具。AISI还发布了关于沙箱技术的参考材料[AI安全研究所,2026年],并为Inspect AI开源了沙箱插件[AI安全研究所,2024年]。这些网络安全靶场使用Inspect的Proxmox沙箱提供程序[AI安全研究所,2025年],该提供程序允许Inspect创建和管理虚拟机集群(最强的基于软件的主机隔离)。截至此次事件,Inspect的Proxmox沙箱提供程序可配置为允许网络安全靶场所组成的虚拟机拥有完全或零互联网访问权限。 导致此次事件的前期评估中,CAST正在两个网络靶场对人工智能模型进行测试,作为即将推出的一款研究产品数据收集的一部分。所涉及的两个网络靶场分别是“Doing Life v1”(DL-v1)和“Doing Life v2”(DL-v2)。这两个靶场共享相同的环境和目标,但DL-v2呈现出更复杂的攻击路径,因为其中增加了一系列网络安全控制措施。一个关键的区别在于代理的起始位置:在DL-v1中,代理从目标网络内部开始(假定已被攻陷),而在DL-v2中,代理从目标网络外部开始,必须首先通过单个入口点实现初始访问。 通过生产API访问的七个模型进行了评估。此次事件中涉及的两个模型均关闭了模型提供方的网络分类器(Mythos 5和GPT-5.6 Sol)。所测试的模型中没有专门训练用于提供帮助的模型。与我们常规的网络安全测试一致,这些模型被赋予了互联网访问权限以协助完成任务(详见第5.1节)。系统本身以及任务说明中均未明确禁止哪些互联网使用行为(详见第5.5节)。 2.1 评估实验的配置方式 • 完成状态。一个样本被定义为代理完成评估的一次尝试。所有样本均设置为最大 100 亿或200 亿 token 的限制。其中一些样本成功完成,而另一些则在测试过程中因事件响应而被中断。作为参考,一个最大 200 亿 token 的样本,根据模型推理延迟的不同,可能需要 40到 50 小时才能完成。 • 无需人工干预。AISI 使用一种自定义的自主代理框架,代理在接收到初始指令后即可独立完成任务,无需进一步的人工干预。 • 代理设计。AISI的自定义代理运行在一个安装了常用渗透测试工具的Kali Linux虚拟机中,这是一种常被人类用于网络安全任务的操作系统。该人工智能代理会不断进行推理,以确定下一步行动。 逐步执行动作并观察结果后继续。该代理可以执行 Bash 命令、Python 代码和 Mythic命令(一个开源的命令与控制框架)。该设计遵循代理设计的常见 ReAct(推理 + 行动)范式 [Yao 等人,2023],并刻意保持极简、可复现,旨在隔离底层模型的贡献而非专业化的框架。所有评估均使用 Inspect AI 框架 [AI Security Inst