前沿人工智能风险管理框架(1.0版)
核心观点: 该框架旨在为通用型人工智能(GPAI)模型研发者提供全面的风险管理指导,主动识别、评估、缓解和治理可能对公共安全和国家安全构成威胁的严重人工智能风险。
框架内容:
- 风险识别: 重点关注GPAI可能引发的四大核心风险类型:滥用风险、失控风险、意外风险及系统性风险。识别范围包括语言模型、AI智能体、生物基础模型和具身智能模型。
- 风险阈值: 定义了不可接受的“红线”和早期预警的“黄线”,涵盖网络攻击、生物威胁、大规模说服与有害操控以及失控风险等关键领域。
- 风险分析: 建议在AI全生命周期中实施动态风险分析,包括规划与研发阶段、部署前和部署后阶段,以判断模型是否越过黄线。
- 风险评价: 建立三级风险分级体系(绿色、黄色、红色区域),根据风险等级指导风险缓解和模型部署决策。
- 风险缓解: 构建全生命周期纵深防御风险缓解策略,包含安全训练措施、部署缓解措施及模型安保措施,并根据风险区域设定不同的保障级别。
- 风险治理: 提出监督和调整整个风险管理流程的治理路径,包括内部治理机制、透明度与社会监督、应急管控机制、政策定期更新和反馈机制。
关键数据和研究结论:
- 框架识别出多个高影响滥用风险种类,包括网络攻击风险、生物化学风险、人身伤害风险以及大规模说服与有害操控风险。
- 明确了针对生物安全风险、网络攻击风险、大规模说服与有害操控风险以及失控风险的不可接受后果(红线)和触发更高级别安全保障措施的早期预警指标(黄线)。
- 建议AI研发者采用多维度的方法覆盖研发前、研发中、部署前和部署后各阶段进行风险分析,并建立部署后持续监测机制。
- 提出采用纵深防御策略,贯穿AI生命周期的全过程,通过整合强有力的技术防护措施与治理机制,实现系统性风险管理。
- 强调AI安全是一项全球公共产品,呼吁全球科技界、政策制定者及相关方采用兼容的风险管理框架,以协同共治、系统施策的方式应对AI带来的风险与机遇。