开发者内部AI模型使用风险报告 作者 奥斯卡·德莱尼 – 研究助理 † 萨姆巴夫·马赫什瓦里 – 研究助理 乔·奥布莱恩– 研究员 西奥·比尔曼 – 研究员 奥利弗·盖斯特 – 研究经理 摘要 前沿人工智能公司首先会将他们最先进的模型部署内部,进行数周或数月的安全测试、评估和迭代,才有可能进行公开发布。例如,Anthropic最近开发了一款具有先进网络防御相关能力的新模型类别——Mythos Preview,该模型在公开宣布前已内部使用至少六周。这种内部使用会带来外部部署框架可能无法解决的风险。 法律框架,特别是加利福尼亚州的《前沿人工智能透明度法案》(SB 53)、纽约州的《负责任人工智能安全与教育法案》(RAISE法案)以及欧盟的《通用人工智能实践守则》,都讨论了内部人工智能使用的风险。它们要求前沿开发者制定并实施管理内部使用风险的计划,并提交内部使用风险报告,描述其安全措施和任何残留风险。本指南为公司提供了统一标准,以制作适用于上述三个监管框架的内部使用风险报告。它主要面向前沿人工智能开发者的评估与安全团队,次要面向监管机构和审计人员,以了解良好报告的范例。 鉴于人工智能研发自动化的步伐以及外部对公司内部使用其最强大模型的运作方式了解有限,定期且详细的 risk 报告可能是确保内部人工智能使用风险在其实际发生前被识别和管理的一种少数机制。每当部署了本质上更强大或风险更高的内部模型时,开发者应创建风险报告,并论证该模型为何可以安全部署。我们围绕两个威胁向量——自主人工智能不当行为和内部威胁——以及每个向量下的三个风险因素:手段、动机和机会——来构建报告框架。 执行摘要 前沿人工智能公司首先将其最先进的模型部署内部,进行数周或数月的安全测试、评估和迭代,才有可能进行公开发布。例如,Anthropic最近开发了一款具有先进网络防御相关能力的新模型类别——Mythos Preview,该模型在公开宣布前已内部使用至少六周。¹ 这种内部使用²会带来外部部署框架可能无法解决的风险。 法律框架,特别是加利福尼亚州的《前沿人工智能透明度法案》(SB 53)、纽约州的《负责任人工智能安全与教育法案》(RAISE)法案,以及欧盟的《通用人工智能实践守则》,均讨论了内部人工智能使用的风险。它们要求前沿开发者制定并实施管理内部使用风险的计划,并提交内部使用风险报告,描述其安全措施及任何剩余风险。3 本指南为公司提供了统一标准,以制作适用于上述三个监管框架的内部使用风险报告。它主要面向前沿人工智能开发者的评估与安全团队,次要面向监管机构和审计人员,以了解良好报告的范例。 图1:内部AI模型使用的风险分类法。三种风险因素(左侧)与一个或两个威胁向量(中间)的组合,可能导致右侧的任何有害结果。 图1总结了内部AI模型的风险格局。鉴于AI研发自动化的速度以及公司对其最强大的模型内部使用方式的外部可见性有限,定期且详细的风险报告可能是确保内部AI使用风险在其实际发生前被识别和管理的一种少数机制之一。每当部署一个能力显著更强或风险更高的内部模型时,开发者应创建风险报告,并论证该模型为何安全可部署。表1总结了报告应针对每个威胁向量和风险因素的组合包含的一些关键指标。 目录 3.1 The Risk Framework............................................................................................. 103.3 Reporting Standards............................................................................................ 13摘要................................................................................................执行摘要............................................................................................目录................................................................................................1. 内部模型为何带来独特风险....................................................................5威胁向量与有害后果.........................................................................62. 内部使用风险报告的法律依据.......................................................................3. 风险因素与报告范围...............................................................................3.2 报告覆盖范围与频率........................................................................114. 自主AI不当行为...................................................................................4.1 证据:手段..................................................................................................15 5. 内部威胁.........................................................................................5.1 证据:手段..................................................................................................21 结论................................................................................................致谢................................................................................................参考文献............................................................................................ 1.内部模型为何带来独特风险 前沿人工智能公司内部模型的潜在风险,与外部部署系统的风险有所不同,有时甚至更大。 内部模型拥有对敏感系统的优先访问权限。内部模型——以及使用它们的员工——通常可以访问训练基础设施、安全评估流程、模型权重、安全控制以及专有代码库等敏感系统。随着这些模型集成到关键工作流程中,例如代码审查、安全监控和研究,它们所创建的攻击面也随之相应扩大。 内部模型缺乏外部监督。公司内部专用的模型在开发和测试过程中,外部审查有限。2025年国际人工智能安全报告指出,“关于内部部署的情况公开知之甚少”。6 有些模型可能根本不会公开发布,这意味着它们从未经历过伴随产品发布而来的外部红队测试、审计和公众审查。7 内部模型比公共模型功能更强。任何公司在特定时间点功能最强的系统,通常在公开发布前会内部部署数周或数月。8 例如,OpenAI的GPT-4在其公开发布前内部使用了大约六个月。9 然而,近来这种内部独占期已缩短;例如,GPT-5仅由承包商进行了三周的安全测试。10 Anthropic的Claude Mythos预览版——于2026年4月发布给一小部分网络安全合作伙伴——从2026年2月下旬开始内部部署。但是,Anthropic不计划让该模型普遍商业化,理由是如果其自主的零日漏洞发现和利用能力被广泛使用,将加速针对主要操作系统和浏览器的网络攻击活动。11 更强的能力意味着更大的潜在意外和蓄意损害风险。 此外,前沿公司的内部人士可能会使用或开发仅有助于模型变体——这些模型版本通常不应用通常用于面向公众的模型的安全过滤器。这种做法大大增加了被滥用的可能性。 这些特点将随着AI模型日益深入地集成到自动化AI研发中而加剧: ● 公司可能更不愿意公开部署那些能显著加速人工智能研发的模型,以免帮助竞争对手。13这种不情愿可能会扩大内部与公开人工智能能力之间的差距,使内部模型更具危险性、更不显眼,并成为对手进行窃取的目标。14 ● 自动化内部研发的超人速度可能会使人类监督能力面临压力。● 用于自动化人工智能研究的AI模型将需要广泛访问公司代码库、训练基础设施和计算资源来运行实验。这种特权访问增加了模型不当行为可能造成的损害。15 因此,将AI模型用于自动化研发的内部使用是风险报告的一个关键焦点。对AI研发自动化范围进行详细报告,可以为政府和公众提供AI能力加速发展的领先指标。 威胁向量与有害后果 内部模型存在两大主要威胁向量,这已在人工智能首尔峰会16上达成的《前沿人工智能安全承诺》中得到认可,并体现在包括Anthropic17、Google DeepMind18和OpenAI19在内的领先人工智能开发者的安全框架中。 12 系统卡:“克劳德神话预览”,作为实践中使用“仅助益”变体的近期例子,参见Anthropic,“§1.1.4”(指出在训练期间,“仅助益”快照与标准模型并存)和“§2.2.5.2”(在针对Opus 4.6辅助和非辅助对照的病毒学协议升级试验中部署“仅助益”的Mythos预览快照)。系统卡还报告了针对“仅助益”变体运行安全防护规避和影响力操作评估,以隔离原始能力(§§4.4和8.3)。13 Anthropic,“检测和预防蒸馏攻击”;Robinson,“Anthropic撤销OpenAI的Claude访问权限”;Acharya和Delaney,“管理内部AI系统的风险”。15 Acharya和Delaney,“管理内部AI系统的风险”。16 《前沿AI安全承诺》(由16家主要AI公司在首尔签署)明确要求参与者“评估其前沿模型或系统在整个AI生命周期中带来的风险,包括在部署该模型或系统之前,以及在适当的情况下,在训练之前和期间”。参见科学与创新部,“前沿AI安全承诺,2024年首尔峰会”。17 Anthropic将从事自主内部破坏的AI系统列为潜在威胁。参见Anthropic,“负责任的扩展政策”(v3.0,2026年2月24日),§ 1(“高风险破坏机会”的能力阈值);,“§ 2.1. 风险报告:2026年2月 Anthropic”,“”。18 Google描述了“在高风险内部部署中,存在模型破坏人类控制的显著风险”的说明性缓解措施”。参见Google DeepMind,“前沿安全框架版本3.0”。19 OpenAI指出,安全防护“需要同时抵御恶意行为者(无论是内部还是外部)和模型准备状态不匹配风险”。参见OpenAI,“”。 ● 自主式AI不当行为。模型可能自行采取有害行动。这包括对评估进行微妙干预,例如“放水”(故意表现不佳以隐藏能力)或“对齐伪装”(在评估中表现良好,但在部署时追求不同目标)。这也可能包括秘密行动,例如模型试图窃取自身权重或破