前言与目标读者
本报告探讨了模型风险管理(MRM)在AI模型应用、开发、部署和使用方面的重要性,适用于AI开发从业者及AI治理业务和合规监管机构。报告强调了AI模型相关的内在风险,如数据偏见、事实性错误(幻觉)和潜在滥用行为,并提出一个基于模型卡片、数据手册、风险卡片和场景规划的MRM框架,通过持续反馈循环识别和减轻风险,并改进模型开发与风险管理。实施该框架可提高透明度、主动应对风险、做出明智决策,并与利益相关者和监管机构建立信任。
引言与模型风险
AI/ML模型的应用带来了巨大潜力,但也引入了固有的风险,如数据质量问题、模型选择缺陷、一流模型固有的风险、实施和操作错误,以及外部因素的演变。MRM是确保模型负责任和可信赖开发、部署和使用的重要学科。模型风险源于模型本身的固有限制,需要采取积极的风险管理方法。
MRM框架的四大支柱
该框架通过整合四个核心组件构建:
- 模型卡片:提供模型清晰简洁的窗口,详述模型的目标、训练数据、能力、限制和性能,增强透明度并促进知情使用。
- 数据手册:详尽描述用于训练机器学习模型的数据集,记录创建过程、组成部分、预期用途、潜在偏见、限制以及伦理考量。
- 风险卡片:总结人工智能模型所涉及的关键风险,系统性地识别、分类并分析可能出现的问题,并解释当前和计划中的补救措施。
- 场景规划:探索模型可能被滥用或出现故障时所处环境下产生假设状况,帮助识别未预见到的风险并制定缓解策略。
这些技术共同形成一种全面方法,模型卡片提供风险评估信息,数据手册理解模型优点和局限性,风险卡指导场景规划,场景规划反馈到风险管理中,形成持续反馈循环。
全面框架的好处
- 增强透明度、可解释性和问责制:模型卡、数据手册和风险卡对于MRM中的透明度、可解释性和可问责性至关重要。
- 主动风险评估和场景分析:数据手册补充场景规划,进行彻底的风险评估。
- 制定风险缓解策略:将数据手册的洞察融入风险缓解过程中,实现更有针对性的策略。
- 明智决策与模型治理:详细的训练数据和模型特征表格对于指导治理实践至关重要。
- 健壮模型验证:涉及使用反映现实世界情况的多样化数据集进行严格测试。
- 建立信任并增强模型采纳:数据手册确保数据清晰度,模型卡和风险卡促进透明度和负责任的AI开发。
- 持续监控和改进:定期更新模型卡、风险卡和数据手册,以反映模型性能或操作环境的改变。
- 积极社会与伦理影响:数据手册是解决机器学习模型中社会和伦理偏见问题的基础。
- 强有力的治理和监督:确保AI模型开发、使用和维护过程透明、可解释且有责任感。
关键组成部分
1. 模型卡片:理解模型
模型卡片提供模型的透明概述,包括模型细节、训练数据、能力、限制、性能指标、评估方法、模型可解释性和偏差、已知限制等。其优势包括洞察力和透明度、识别潜在风险、可复制性/可问责性、风险管理的基础、风险缓解的益处等。创建和更新模型卡片需要采用协作和自动化的方法,并利用标准化的模板和版本控制系统。
2. 数据手册:检查训练数据
数据手册提供对机器学习模型的深入技术描述,包括模型目的和范围、数据输入和假设、模型架构、模型开发过程、训练数据特征、训练过程、性能指标、模型输出和解释、假设和限制等。其需求源于模型卡片和风险卡片为风险管理提供了宝贵的见解,但仍需添加一个基本要素:模型内部逻辑的透明视图。数据手册在模型风险管理(MRM)中的作用包括风险识别与应对、模型验证和细化、监管合规等。
3. 风险卡片:识别潜在问题
风险卡片深入研究了与人工智能模型相关的潜在问题,系统地识别、分类和分析潜在风险,包括安全和道德风险、安全风险、社会风险、环境风险、操作风险、法规和法律风险、财务风险、供应链风险、声誉风险等。风险卡片的结构包括风险分类、风险描述、影响、严重性等级、可能性、应对策略等。其好处包括前瞻性方法、压力测试、改进决策等。
4. 场景规划:“假设”方法
场景规划是一种主动探索AI模型可能被误用或出现故障的假设情况的方法,通过“如果会怎么样”的问题识别潜在风险。场景规划考虑积极和消极情景,需要考虑技术能力、数据偏见、用户交互、社会影响等方面。场景规划如何运作包括组建团队、定义范围和目标、确定要深入研究的场景的优先顺序、收集信息、开发情景、评估情景、制定缓解策略、优先实施缓解策略、记录和沟通等步骤。场景规划的好处包括主动识别和缓解风险、改进决策、提高透明度和信任度、可持续模型开发等。
总体技术:一种整合方法
将模型卡片、数据手册、风险卡片和场景规划整合到一个全面的风险管理框架(RMF)中,具体方法包括:
- 利用模型卡信息创建风险卡:模型卡中记录的信息为全面风险评估过程提供了必要的输入,从而创建准确反映每个模型优势和劣势的风险卡。
- 使用数据手册加强模型理解:数据手册提供了模型内部工作方式的简洁且易于理解的概述,促进对其优势和局限性的深入理解。
- 使用风险卡指导场景规划:风险卡片指导场景规划实践,并将场景规划结果反馈到风险管理中,形成一个持续的反馈循环。
- 场景规划对风险管理和开发的反馈:场景规划的洞察可以完善现有的风险评估,并识别出新的、未预见到的风险,这种持续的反馈循环加强了整体框架。
- 持续监督:定期回顾并更新场景规划,将场景规划练习整合到开发生命周期中,持续监控和评估风险缓解策略的有效性。
AIMRM在行动
通过探索一个现实世界的应用,展示了场景规划如何转化为具体行动,使我们能够主动识别在现实世界应用中使用AI模型的潜在风险。案例研究探讨了使用大型语言模型(LLM)进行社交媒体内容审核的潜在风险和机会,并利用模型卡片、风险卡片和数据手册进行场景规划。
结论与展望
通过结合模型卡片、数据手册、风险卡片和场景规划,可以建立一个全面的模型风险管理(MRM)框架,确保负责任的开发,减轻了偏见和数据质量问题等风险,并实现模型的安全和有益使用。未来,模型风险管理(MRM)将扩展本文的内容,提供实践经验、见解,并帮助有效实施这些实践。新的关键领域包括标准化文档、学习运维(MLOps)和自动化的兴起、集成可解释性人工智能(XAI)技术、监管环境的发展、解决社会和伦理问题、注重人机协作等。