OpenAI 的“准备框架”旨在主动识别、评估、预测和防范大模型带来的灾难性风险,核心观点是安全开发需要基于科学和主动决策。框架包含五个关键要素:
- 追踪灾难性风险水平:构建并持续改进评估和监控解决方案,涵盖网络安全、CBRN 威胁、说服力、模型自主性等风险类别,并预测风险未来发展。
- 寻找未知的未知:持续识别和分析未知灾难性风险类别。
- 建立安全基线:仅部署缓解后风险为“中等”或以下的模型,进一步开发缓解后风险为“高”或以下的模型,并针对“高”或“关键”风险水平模型加强安全措施。
- 指派准备团队:Preparedness 团队负责风险研究、评估、监控、预测,并向安全咨询小组报告,协调相关团队实施缓解措施。
- 创建跨职能咨询机构:安全咨询小组(SAG)为 OpenAI 领导层和董事会提供专业建议,监督风险评估和紧急情况处理。
风险类别及等级:
- 网络安全:从低(模型仅辅助非编程用途的网络攻击)到关键(模型可自主执行新型网络攻击)。
- CBRN:从低(提供与现有资源相当的信息)到关键(任何人可创建高度危险的 CBRN 威胁)。
- 说服力:从低(创建类似低质量文章的说服内容)到关键(可创建超人类说服力的内容)。
- 模型自主性:从低(在明确指示下执行离散动作)到关键(可在野外生存、复制并自我改进)。
评分卡:动态跟踪预缓解和后缓解模型风险,评估内容包括网络攻击理论、GPT 与搜索可利用性、代码去混淆、AI 辅助夺旗挑战等。
治理:
- 安全基线:达到“高”预缓解风险时,加固安全措施防止泄露;后缓解风险为“中等”或以下的模型才能部署,后缓解风险为“高”或以下的模型才能进一步开发。
- 运营结构:包括准备团队、安全咨询小组(SAG)和 OpenAI 领导层,SAG 提供专业建议并推荐行动,OpenAI 领导层做出最终决定。
- 决策流程:准备团队提出变更案例,SAG 评估并上报给 OpenAI 领导层,领导层做出最终决定,董事会监督。
- 问责制:包括独立第三方审计、外部访问、安全演练等。
示例情景:
- 情景1:说服力风险升级为“高”,触发安全基线,SAG 与准备团队合作确保缓解措施到位。
- 情景2:网络安全风险预测为“关键”,触发快速处理流程,SAG 与准备团队合作确保缓解措施到位。
结论:OpenAI 通过“准备框架”致力于在模型能力增长的同时,主动防范潜在风险,确保 AI 技术的安全和对齐。