Frontier AI Risk Management Framework 执行摘要 我们对可信AGI的发展愿景 当前人工智能领域正以前所未有的速度发展,各类系统在众多不同领域已经越来越频繁地达到甚至超越人类水平的表现。这些突破性进展为我们解决人类面临的重大挑战提供了历史性机遇——从推动科学发现、改善医疗健康服务水平,到促进经济生产力的提升等。但与此同时,快速发展的技术也带来了前所未有的风险。随着先进人工智能的研发与部署速度超越关键安全措施的发展速度,建立健全风险管理机制已成为当务之急。 作为我国人工智能领域的新型科研机构,上海人工智能实验室致力于打造“突破型、引领型、平台型”一体化的大型综合性研究基地,推动AI技术的安全有益发展。为积极应对技术发展带来的挑战,推动全球在AI安全领域的良性竞争,实验室提出了AI45度平衡律[1],作为实现可信AGI的发展路线图。 前沿人工智能风险管理框架 上海人工智能实验室联合安远AI1,于2025年7月正式发布《前沿人工智能风险管理框架(1.0版)》,旨在为通用型人工智能(General-Purpose AI)模型研发者提供全面的风险管理指导方针,主动识别、评估、缓解和治理一系列对公共安全和国家安全构成威胁的严重人工智能风险,保障个体与社会的安全。 本框架旨在为通用型人工智能模型研发者管理其通用型人工智能模型可能带来的严重风险提供指导。框架充分借鉴了安全攸关型行业的风险管理标准与最佳实践,涵盖风险管理的六大核心流程:风险识别、风险阈值、风险分析、风险评价、风险缓解及风险治理(详见下文“框架总览”)。 1.5版本的新增内容 2026年2月,我们正式发布了框架的1.5版本。新版本的关键更新包括: •失控风险章节扩写:为更好地实施“人类最终控制”和“前瞻预防应对”等核心原则2,以防范人工智能技术失控,我们细化了与失控风险相关的场景和阈值,同时加强了智能体监督措施和应急响应机制相关的内容,旨在为学界与业界提供指导,帮助其持续监测相关风险。•风险分析实操化:为使该框架更具可操作性,我们更新了面向通用型人工智能模型提供方的风险分析指南。通过阐明该过程中的关键环节——如模型评测、模型激发、风险建模与估计等,我们希望能够方便开发者在有效落实有关风险分析的最佳实践(详见第3节:风险分析)。•互操作性增强:我们对照国内外领先的人工智能风险管理指南,特别是全国网络安全标准化技术委员会TC260《人工智能安全治理框架2.0》和欧盟《通用型人工智能模型行为准则(安全与安保章节)》 ,对本框架的风险管理措施开展了映射分析,此举有助于开发者采纳国内外主要监管指南共同推荐的安全措施(详见 附录一 和 附录二)。 1安远AI(Concordia AI)是一家AI安全与治理领域第三方研究和咨询机构,同时是目前该领域中国唯一的社会企业。2“人类最终控制”和“前瞻预防应对”是《人工智能安全治理框架》2.0版[2]的“附件2.可信人工智能基本原则”中涵盖的两项原则。 人工智能安全作为全球公共产品 作为率先提出此类综合性框架的非营利人工智能实验室之一,上海人工智能实验室坚信AI安全是一项全球公共产品[3, 4]。本框架汇集了我们现阶段对重大AI风险的认知以及风险预测和应对建议,我们倡导前沿AI研发机构、政策制定者及相关方采用AI风险管理框架。随着AI能力的高速演进,唯有尽快在当下采取集体行动,才能让变革性AI真正造福人类,并避免灾难性后果。我们诚邀各方就框架落地开展合作,并承诺以公开透明的方式分享实践成果。只有当关键组织都采纳并同步落实同等强度的防护措施,社会层面的风险缓解才能实现。面对风险与机遇并存的全新局面,唯有以协同共治、系统施策的思维,方能凝聚合力、破局前行。 贡献与致谢 2025年7月版本 科学总监周伯文主要撰稿人谢旻希†、方亮*、徐甲*、段雅文*、邵婧*贡献者张杰、刘东瑞、王伟冰、程远、俞怡、郭嘉轩、陆超超 †表示第一作者*表示等同贡献 2026年2月更新版本 贡献者段雅文、方亮、徐甲、邵婧、谢旻希、张杰、王伟冰、胡侠 致谢 感谢梁家铭、陈欣怡、刘顺昌以及上海人工智能实验室和安远AI的其他同事给予的宝贵支持与贡献。 如何引用本报告 Shanghai AI Lab and Concordia AI. 2026.Frontier AI Risk Management FrameworkFebruary2026. 版本与更新计划 《前沿人工智能风险管理框架》旨在成为一份持续迭代的动态文档。我们将定期审阅并评估本框架的内容及其实用性,以适时进行更新。关于《前沿人工智能风险管理框架》的任何意见或建议,均可随时通过电子邮件发送至主要撰稿人,我们将每半年进行一次集中审阅和整合。 当前版本:1.5(2026年2月) 更新日志 1.5版本(2026年2月) •扩充并完善了与失控风险相关的风险场景、风险阈值、智能体监督措施以及应急响应机制。•更新了风险分析指南,明确关键环节(模型评测、模型激发、风险建模与估计)。•对照全国网络安全标准化技术委员会TC260《人工智能安全治理框架2.0》和欧盟《通用型人工智能模型行为准则》(安全与安保章节),对本框架的风险管理措施进行了映射分析,以增强互操作性。 1.0版本(2025年7月) •《前沿人工智能风险管理框架》首次发布。 目录 执行摘要i 贡献与致谢iii 版本与更新计划 iv 目录v 框架总览1 1风险识别 4 1.1风险识别范围. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .41.2风险分类体系. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .51.3滥用风险. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .51.4失控风险. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .71.5意外风险. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .81.6系统性风险. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .9 2风险阈值10 2.1界定人工智能开发的“黄线”和“红线”. . . . . . . . . . . . . . . . . . . . . . . . . . . . . .102.2明确特定领域的红线. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .11 3风险分析 3.1情境分析. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .163.2模型评测. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .173.3风险建模与估计. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .193.4部署后风险监测. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .203.5全生命周期实施. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .21 4风险评价 4.1缓解前的风险处置选项. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .234.2缓解后剩余风险评价与部署决策. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .234.3部署决策的外部沟通. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .25 5风险缓解 26 5.1安全训练措施. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .275.2部署缓解措施. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .285.3系统安全措施. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .295.4全生命周期风险缓解. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .30 6风险治理32 6.1内部治理机制. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .336.2透明度和社会监督机制. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .346.3应急管控机制. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .356.4政策更新与反馈机制. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .36 附录三:关键术语 参考文献 框架总览 本框架为通用型人工智能模型开发者提供了一套结构化方法,以主动识别、评估、缓解和治理严重AI风险。本框架将既有的风险管理原则应用于前沿人工智能的研发,并与ISO 310002018、ISO/IEC238942023和GB/T 243532022等标准保持一致3。本框架由两个互补的部分构成:一是一套六阶段风险管理流程,用于界定开发者应该做什么;二是一套三维分析框架(部署环境–威胁源–使能能力),用于指导开发者在各个阶段应当如何考虑风险。 人工智能风险管理的六个阶段 我们建议开发者采用六个阶段的风险管理循环。如图1所示,这一循环贯穿人工智能开发的全生命周期并持续迭代。其中,每一阶段的输出都将直接输入到后续阶段,而整个流程则由一套治理机制进行监督和衔接。 •第1阶段–风险识别(第1节):我们建议开发者对通用型人工智能模型的高影响能力可