本文介绍了初步的 AI 风险缓解分类法,旨在整理和提供 AI 风险缓解的共同参考框架。该分类法通过快速证据扫描,从 2023 年至 2025 年间发布的 13 个 AI 风险缓解框架中提取了 831 个不同的 AI 风险缓解措施,并进行了迭代聚类和编码。
初步的 AI 风险缓解分类法将缓解措施分为四个类别和 23 个子类别:
- 治理与监督:建立人类监督机制和决策协议的正式组织结构和政策框架。
- 技术与安全:确保安全、安全符合人类价值观和内容完整性,以保护 AI 系统并约束模型行为的技术、物理和工程保障措施。
- 运营流程:管理 AI 系统部署、使用、监控、事件处理和验证的流程和管理框架,在整个系统生命周期中促进安全、安全和问责制。
- 透明度与问责制:正式披露实践和验证机制,传达 AI 系统信息并允许外部审查,以建立信任、促进监督并对用户、监管机构和公众负责。
研究发现,“风险管理”是文献中最常被引用的子类别,但定义不一致。测试和审计是最常被引用的子类别,而利益冲突保护、举报人报告和保护、环境影响管理、模型对齐和分阶段部署等类别则相对较少被提及。
该分类法及其相关的缓解数据库为 AI 生态系统中的不同参与者提供了一个可访问的结构化方式,以讨论和协调行动,以减少 AI 的风险。未来研究方向包括将 AI 风险缓解措施映射到其旨在解决的风险,探索减少 AI 风险的组织条件,以及研究不同行为者之间的差异及其相互作用。