Frontier AI Risk Management Framework 2.0 执行摘要 可信AGI的发展愿景 当前,人工智能领域正以前所未有的速度发展,各类系统在诸多领域已经越来越频繁地达到甚至超越人类水平。这些突破性进展,为解决人类面临的重大挑战提供了历史性机遇,包括推动科学发现、促进生产力提升、提高医疗健康服务水平等。但与此同时,快速发展的技术也带来了前所未有的风险。随着先进人工智能的研发与部署速度超越关键安全措施的发展速度,建立健全风险管理机制已成为当务之急。 作为我国人工智能领域的新型科研机构,上海人工智能实验室致力于打造“突破型、引领型、平台型”一体化的大型综合性研究基地,推动人工智能技术安全、有益发展。为积极应对技术发展带来的挑战,推动全球在人工智能安全领域的良性竞争,实验室提出了“AI45度平衡律”[1],作为实现可信AGI的发展路线图。 前沿人工智能风险管理框架 上海人工智能实验室联合安远AI1,于2025年7月正式发布《前沿人工智能风险管理框架(1.0版)》,旨在为通用型人工智能模型开发者提供全面的风险管理指导方针,主动识别、评估、缓解和治理一系列对公共安全和国家安全构成威胁的严重人工智能风险,保障个体与社会的安全。 本框架旨在为通用型人工智能模型研发机构提供指导,以管理其通用型人工智能模型可能带来的严重风险。框架充分借鉴了安全攸关型行业的风险管理标准与最佳实践,涵盖风险管理的六大核心流程:风险识别、风险阈值、风险分析、风险评价、风险缓解及风险治理(详见下文“框架总览”)。 自1.0版本以来的主要更新 2026年7月,我们正式发布了框架的2.0版本。自1.0版本以来(含1.5版与2.0版的迭代),核心更新包括: •失控风险相关内容更新:为更好地落实“人类最终控制”和“前瞻预防应对”等核心原则2,防范人工智能技术失控,2.0版细化了与失控风险相关的场景和阈值,同时加强了智能体监督措施和应急响应机制的相关内容,旨在指导学界与业界持续监测相关风险。 •红线风险场景迭代:2.0版新增了化学安全红线风险场景,迭代了生物安全风险、网络攻击风险、大规模说服和有害操纵风险和失控风险的红线场景。•风险分析实操化:为了使该框架更具可操作性,2.0版更新了面向通用型人工智能模型开发者的风险分析指南,通过阐明该过程中的关键环节(模型评测、模型激发、风险建模与估计等),帮助开发者更有效地落实风险分析的最佳实践(详见第3节:风险分析)。•互操作性增强:我们对照国内外领先的人工智能风险管理指南,特别是全国网络安全标准化技术委员会TC260《人工智能安全治理框架2.0》和 欧盟《通用型人工智能模型行为准则(安全与安保 章节)》,对本框架的风险管理措施开展了映射分析,帮助开发者充分采纳国内外主要监管指南共同推荐的安全措施(详见附录一和附录二)。 作为全球公共产品的人工智能安全 作为率先提出此类综合性框架的非营利人工智能实验室之一,上海人工智能实验室坚信人工智能安全是一项全球公共产品[3, 4],并倡导前沿人工智能研发机构、政策制定者及相关各方采用风险管理框架。本框架汇集了我们现阶段对重大人工智能风险的认知、预测和应对建议。如今,人工智能能力正在高速演进,面对此风险与机遇并存的局面,唯有尽快采取集体行动,协同共治、系统施策,才能让变革性人工智能在真正造福人类的同时避免灾难性后果。我们诚邀各方就框架落地开展合作,采纳、落实同等强度的防护措施,并承诺以公开透明的方式分享实践成果,力求实现社会层面的风险缓解目标。 贡献与致谢 2.0版本(2026年7月) 贡献者段雅文、李心宁、张静昕、王金戈、张杰、王伟冰、俞怡、方亮、徐甲、邵婧、谢旻希、胡侠 1.5版本(2026年2月) 贡献者段雅文、方亮、徐甲、邵婧、谢旻希、张杰、王伟冰、胡侠 1.0版本(2025年7月) 科学总监周伯文主要撰稿人谢旻希†、方亮*、徐甲*、段雅文*、邵婧*贡献者张杰、刘东瑞、王伟冰、程远、俞怡、郭嘉轩、陆超超†表示第一作者*表示等同贡献 致谢 感谢以下专家对具体风险领域提出的宝贵建议: •网络安全:奇安信人工智能公司副总裁刘岩,复旦大学计算机科学技术学院助理教授戴嘉润;•生物安全与化学安全:天津大学生物安全战略研究中心创始主任张卫文,天津大学系统生物工程教育部重点实验室副教授王方忠,智源研究院大语言模型安全中心研究员易婧玮,广州实验室ABSL3实验副主任于学东,广东医科大学药学院教授刘建强。 感谢杨祎、陈欣怡、梁家铭、刘顺昌以及上海人工智能实验室和安远AI的其他同事给予的宝贵支持与贡献。 如何引用本报告 Shanghai Artificial Intelligence Laboratory and Concordia AI. 2026.Frontier AI Risk ManagementFramework 2.0 July 2026. 上海人工智能实验室、安远AI,(2026),《前沿人工智能风险管理框架2.0(2026年7月)》。 版本与更新计划 《前沿人工智能风险管理框架》旨在成为一份持续迭代的动态文档。我们将定期审阅并评估本框架的内容及实用性,并适时更新。如有关于《前沿人工智能风险管理框架》的意见或建议,可随时通过电子邮件发送至主要撰稿人,我们将每半年进行一次集中审阅和意见整合。 当前版本:2.0(2026年7月) 更新日志 2.0版本(2026年7月) •失控风险相关章节更新:纳入了监督退化的贯穿性使能因素,并将内部部署环境视为关键风险产生的部署环境。•红线风险场景迭代:新增了化学安全红线风险场景,迭代了生物安全风险、网络攻击风险、大规模说服与有害操纵风险和失控风险的红线场景。 1.5版本(2026年2月) •扩充并完善了与失控风险相关的风险场景、风险阈值、智能体监督措施及应急响应机制。•更新了风险分析指南,明确了关键环节(模型评测、模型激发、风险建模与估计等)。•对照全国网络安全标准化技术委员会TC260《人工智能安全治理框架2.0》和欧盟《通用型人工智能模型行为准则》,对本框架的风险管理措施进行了映射分析,增强了互操作性。 1.0版本(2025年7月) •《前沿人工智能风险管理框架》首次发布。 目录 执行摘要i 贡献与致谢 iii 版本与更新计划 iv 框架总览1 1风险识别 4 1.1风险识别范围. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .41.2风险分类体系. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .51.3滥用风险. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .51.4失控风险. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .71.5意外风险. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .81.6系统性风险. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .9 2风险阈值 2.1界定人工智能开发的“黄线”和“红线” . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .102.2明确特定领域的红线. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .12 3风险分析 3.1情境分析. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .183.2模型评测. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .193.3风险建模与估计. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .213.4部署后风险监测. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .223.5全生命周期实施. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .23 4风险评价 4.1缓解前的风险处置选项. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .264.2缓解后剩余风险评价与部署决策. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .264.3部署决策的外部沟通. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .28 5风险缓解 29 5.1安全训练措施. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .305.2部署缓解措施. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .315.3系统安全措施. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .325.4全生命周期风险缓解. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .33 6风险治理34 6.1内部治理机制. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .356.2透明度和社会监督机制. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .366.3应急管控机制. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .376.4政策更新与反馈机制. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .38 附录三:关键术语 49 参考文献 框架总览 本框架旨在为通用型人工智能模型开发者提供一套结构化方法,用于主