2026年2月5日 内容 1 简介 32 基线模型安全评估 2.1 不允许的内容评估............................3 3 产品特定风险缓解措施 3.1 代理沙盒.....................................43.2 网络访问.....................................5 4 针对特定模型的缓解措施 4.1 避免破坏性数据操作............................54.1.1 风险描述.................................5 65 应急准备 5.1.1 生物与化学............................65.1 能力评估................................65.1.1.1 隐性知识与故障排除...............75.1.1.2 协议QA开放式......................8 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .105.1.2 网络安全 5.1.2.1 捕旗赛(专业)................... 125.1.2.2 CVE-Bench.............................. 13 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .185.1.3.1Monorepo-Bench . . . . . . . . . . . . . . . . . . . . . . . . . . .185.1.3.2OpenAI-Proof Q&A. . . . . . . . . . . . . . . . . . . . . . . . .195.1.3 人工智能自我改进 . . . . . . . . . . . . . . . . . .20. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .21. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .21. . . . . . . . . . . . . . . . . . . .225.2.1.2Cyber Threat Taxonomy. . . . . . . . . . . . . . . . . . . . . .225.2.1.3Safeguards. . . . . . . . . . . . . . . . . . . . . . . . . . . . . .235.1.4 研究类别更新:蓄沙策略5.2 安全评估5.2.1 网络安全保护措施5.2.1.1 威胁模型与场景5.2.1.3.1 模型安全培训................... 245.2.1.3.2 对话监控................... 24 5.2.1.4Security Controls . . . . . . . . . . . . . . . . . . . . . . . . . . .285.2.1.6 风险缓解措施是否充分.............. 295.2.1.5misalignment risks and internal deployment............ 28 1 简介 GPT-5.3-Codex 是迄今为止最强大的代理式编码模型,它结合了 GPT-5.2-Codex 的前沿编码性能以及 GPT-5.2 的推理和专业知识能力。这使得它能够承担涉及研究、工具使用和复杂执行的长任务。就像一位同事一样,在 GPT-5.3-Codex 工作时,你可以引导和与之互动,而不会丢失上下文。 与其他近期模型类似,它被视为生物领域的高能力模型,并配备了GPT-5系列中我们用于其他模型的相应安全防护措施。它尚未达到人工智能自我改进的高能力水平。 这是我们根据我们的准备框架,在网络安全领域首次将其视为高能力并启动相关防护措施的情况。我们没有确凿的证据表明该模型达到了我们的高门槛,但由于无法排除其能力足以达到门槛的可能性,我们采取了预防性措施。我们在网络安全方面的针对高能力的防护措施,依赖于一个分层安全架构,旨在阻碍和破坏威胁行为者,同时我们努力让这些相同的能力尽可能易于网络防御者获取。 2 基线模型安全评估 2.1 不允许的内容评估 为深入了解前沿人工智能生态系统,并遵循我们的常规做法,我们在此提供 GPT-5.3-Codex 在对话场景下针对被禁止内容类别的基准评估结果。以下展示了其中一部分评估。我们认为,针对这种以代码为重点的模型,这些对话评估结果并不能反映现实世界中的风险。1 我们在此报告我们的生产基准(Production Benchmarks),这是一个包含具有代表性的对话的评价集,这些对话来自生产数据中的具有挑战性的示例。正如我们在之前的系统卡片中所述,由于我们早期针对这些类别的标准评估(Standard evaluations)已相对饱和,我们引入了这些生产基准,以帮助我们衡量持续的进展。 这些评估是故意设计得困难的。它们围绕着我们现有模型尚未给出理想响应的案例构建而成,这反映在下表中的分数上。错误率并不能代表平均生产流量。主要指标是_not_unsafe,用于检查模型是否生成了违反相关OpenAI政策的内容。 我们持续改进我们的禁止内容评估和类别,并将这些最新评估的性能与最新的GPT-5.2-Thinking作为基线进行比较。GPT-5.3-Codex在对话环境中通常表现与GPT-5.2-Thinking相当或接近。正如GPT-5.1-Codex-Max系统卡中所解释的,该模型并非为对话使用而设计。 3 产品特定风险缓解措施 3.1 代理沙盒 代码本代理旨在运行在隔离、安全的环境中,以在任务执行过程中最大限度地降低潜在风险。沙盒方法由接口决定,在使用代码本本地或云端时有所不同。 在使用云端Codex时,代理程序在一个由OpenAI托管的隔离容器中运行,这实际上相当于一台默认网络访问被禁用的个人计算机。这种容器化环境可防止代理程序与用户的宿主系统或其指定工作区以外的敏感数据进行交互。 在 MacOS、Linux 和 Windows 上本地使用 Codex 时,代理默认在沙盒中执行命令。在 MacOS上,此沙盒通过 MacOS 内置功能 Seatbelt 政策强制执行。在 Linux 上,结合使用 seccomp和 landlock 来实现类似的隔离。在 Windows 上,用户可以使用原生沙盒实现,或通过 Windows Subsystem for Linux (WSL) 利用 Linux 沙盒。当模型无法在沙盒中成功运行命令时,用户可以批准以无沙盒、完全访问权限的方式运行命令。 这些默认的沙箱机制旨在: •默认禁用网络访问:这能显著降低提示注入的风险 攻击、数据窃取,或代理程序意外连接到恶意外部资源。 • 限制对当前工作区的文件编辑:这可防止代理修改用户活动项目之外的文件,从而保护关键系统文件并避免意外后果。 用户可以灵活扩展这些功能(例如,启用对特定域的网络访问),但默认配置是经过有意设计的,旨在为风险缓解提供一个稳固的基础。此外,还有用户可配置的规则以及管理员的管理配置。 3.2 网络接入 作为我们迭代部署承诺的一部分,我们最初以严格禁用网络、沙盒化的任务执行环境推出了Codex云。这种谨慎的做法在收集早期反馈的同时,降低了提示注入等风险。用户告诉我们,他们理解这些风险,并希望拥有灵活性,能够决定在任务执行期间为代理提供何种程度的互联网连接。 例如,当代理程序工作时,它可能需要安装或更新用户在环境配置过程中忽略的依赖项。赋予用户选择启用互联网访问的权限——无论是访问特定的允许站点,还是访问整个互联网——这对于解锁许多以前无法实现的应用场景是必要的。 我们允许用户根据每个项目的具体情况,决定在代理运行时允许其访问哪些网站(如果有的话)。这包括提供自定义的允许列表或拒绝列表的功能。启用互联网访问可能会引入风险,例如提示注入、凭证泄露或使用受许可限制的代码。用户应仔细检查输出结果,并将访问权限限制在可信域和安全HTTP方法上。详情请参阅文档:https://developers.openai.com/codex/cloud/agent-internet 4 针对特定模型的缓解措施 我们针对安全缓解措施的方法建立在已为不同接口(包括Codex云和Codex CLI)实施的全面缓解策略之上。本节将专门聚焦于应用于GPT-5.3-Codex模型本身的具体安全训练缓解措施。有关GPT-5.3-Codex所涉及的安全训练的更多信息,请参见下文“准备状态保障措施”的描述。 4.1 避免破坏性数据操作 4.1.1 风险描述 编码代理可以访问强大的工具——文件系统、Git、包管理器和其它开发接口——使它们能够自主行动。虽然这些功能释放了生产力,但也引入了高影响故障模式,涉及数据删除或损坏。 像“清理文件夹”或“重置分支”这样简单的指令可能会掩盖危险的操作(如 `rm -rf`、`gitclean -xfd`、`git reset --hard`、`push --force`),这些操作会导致数据丢失、仓库损坏或安全边界违规。 4.1.2 缓解措施:安全培训 我们观察到,在模型部署过程中遇到用户创建的编辑时,Codex模型更倾向于尝试破坏数据的操作。GPT-5.3-Codex在RL过程中使用了一个“用户模型”,该模型在整个部署过程中会进行相互冲突的编辑。如果模型在部署过程中没有撤销用户的更改,则会获得积极强化。我们还为CodexCLI引入了额外的提示,以确保模型在继续操作前,能够优雅地向用户澄清相互冲突的编辑。 表2:为衡量干预措施的有效性,我们开发了一种新的破坏性行为评估方法,用于评估模型保留用户生成更改并避免采取破坏性行为的能力。 5 应急准备 GPT-5.3-Codex的边界能力,以及与高或关键能力相关的安全措施,均在准备框架下进行评估。 GPT-5.3-Codex 是我们在网络安全领域部署过的最强大的模型。如下方将详细讨论的,这是我们首次将其视为具备高能力级别的网络安全产品。因此,我们认为与高网络安全能力相关的安全防护措施是必要的预防措施。 我们也将GPT-5.3-Codex视为生物与化学领域的高风险,并对其应用与其他获得此资格的模型部署相同的防护措施。 5.1 能力评估 5.1.1 生物与化学 按照我们对GPT-5系列其他模型的做法,我们将GPT-5.3-Codex视为生物与化学领域的“高风险”,并继续采取相应的安全措施。 5.1.1.1 隐性知识与故障排除 我们使用由Gryphon Scientific创建的包含隐性知识和故障排除的多个选择题数据集来评估模型。这些问题涵盖了生物威胁创建过程中的所有5个阶段,并聚焦于隐性知识会成为瓶颈的领域。隐性知识问题旨在对非该领域从业者而言晦涩难懂,即,它们要么需要追踪相关论文的作者,要么需要了解该领域的人。故障排除问题旨在对缺乏实践经验者而言晦涩难懂,即,答案仅为人亲自尝试过该方案的人所知晓。 该套产品未受污染;它完全由我们与格里芬科学公司的合作伙伴内部共同创建,且未公开发表。 GPT-5.3-Codex 的表现与 GPT-5.2-Codex 类似。我们在生物评估中有时观察到拒绝或安全完成的情况。在“隐性知识和故障排除”评估中,GPT-5.1-codex 的拒绝或安全完成率为 6%,GPT-5.2-thinking 为 30%,GPT-5.2-codex 为 0.1%,GPT