本文档规定了生成式人工智能(GenAI)预训练和微调数据及相关处理活动的安全要求,并描述了相应的评估方法。
适用范围:指导GenAI服务提供商开展预训练和微调数据处理活动,进行预训练和微调数据安全自评,也可作为监管评估的参考。
规范性引用:包括GB/T AAAAA《网络安全技术—生成式人工智能数据标注安全规范》等。
术语和定义:明确了生成式人工智能、GenAI服务、服务提供商、服务用户、预训练、微调、预训练数据和微调数据等术语的定义。
概述:
- 安全风险:数据泄露、数据投毒等影响数据安全或GenAI安全的风险。
- 安全框架:包括一般数据安全和数据处理活动的安全。
一般安全要求:
- 对预训练和微调数据进行分类分级管理。
- 采取技术措施进行安全监控,发现缺陷、漏洞等风险时及时预警并处理。
- 采取身份认证、访问控制、加密和备份等技术措施提供安全保护。
- 建立应急响应机制,及时有效处理数据安全事件。
- 记录数据处理活动,确保关键操作可审计和可追溯。
预训练数据处理活动安全要求:
- 数据收集:记录数据来源,确保数据来源多样,审查数据来源的合法性。
- 数据预处理:添加元数据,识别数据中的安全风险内容和知识产权侵权风险。
- 数据使用:使用含个人信息的数据需获得个人同意,使用含敏感个人信息的数据需获得单独同意,不得使用涉及知识产权侵权的数据,采取措施降低GenAI生成安全风险内容的可能性。
微调数据处理活动安全要求:
- 数据收集:符合预训练数据收集要求,记录GenAI模型或服务版本、获取时间等信息。
- 数据预处理:符合预训练数据预处理要求,对GenAI生成内容进行元数据添加和安全风险内容识别。
- 数据使用:符合预训练数据使用要求,过滤含安全风险内容的GenAI生成数据。
评估方法:
- 一般安全评估:检查服务提供商的运营流程记录、管理文档、系统设计文档、操作日志、安全保护措施、应急响应机制和数据处理活动记录等。
- 预训练数据处理活动评估:分别对数据收集、预处理和使用进行评估,检查数据来源记录、元数据、安全风险内容识别记录、知识产权侵权风险识别记录、个人信息和敏感个人信息使用情况等。
- 微调数据处理活动评估:分别对数据收集、预处理和使用进行评估,检查数据来源记录、元数据、数据标注符合性、GenAI生成内容安全风险内容识别记录等。
附录:
- 附录A(参考):预训练和微调数据的主要安全风险,包括违反社会主义核心价值观内容、歧视性内容、商业违规和侵犯他人合法权益等。
- 附录B(规范性):关键词库和分类模型的要求,关键词库应全面、代表性,分类模型应覆盖所有安全风险。