本文件规定了生成式人工智能预训练和优化训练数据及其处理活动的安全要求,并描述了相应的评价方法。文件适用于生成式人工智能服务提供者开展预训练和优化训练数据处理活动以及安全自评估,也适用于第三方机构对预训练和优化训练数据进行安全性评估。
通用安全要求 对服务提供者提出了一系列要求,包括制定安全管理策略、数据存储和传输安全、训练数据隔离和标识、数据处理活动安全、个人信息保护、安全防护措施、系统安全等级、数据删除策略、安全管理团队和监督职能、安全评估和事件响应、行业数据保护、数据真实性评估等。
预训练数据处理活动的安全要求 包括数据收集、数据预处理和数据使用三个方面。数据收集要求对数据进行评估和记录,确保数据来源安全,遵循开源许可协议或取得使用授权文件,记录数据来源信息,同类型数据具有多个不同的数据来源,涉及个人信息时取得个人同意,涉及数据跨境收集时符合相关法规和标准。数据预处理要求对数据进行抽样安全核验,确保预处理环境的安全性,采用安全的传输、存储技术,对个人信息进行去标识化处理,为数据样本添加元数据内容,对训练数据进行过滤,识别和管理知识产权侵权风险,对不同模态和语言的训练数据进行针对性处理。数据使用要求采取措施降低生成式人工智能被诱导生成安全风险内容的可能性,如充分过滤已识别含有安全风险内容的数据样本等。
优化训练数据处理活动的安全要求 与预训练数据处理活动的安全要求类似,但在数据收集方面增加了对生成式人工智能服务生成的数据的记录要求,以及对优化训练数据与优化目标一致性、错误知识、非恰当表达等问题的检查要求。在数据预处理方面增加了对优化训练数据进行过滤的要求,以及对提示词、标注数据、知识蒸馏数据等优化训练数据建立价值对齐检查机制的要求。在数据使用方面增加了建立幻觉风险评估机制的要求。
评价方法 包括通用安全评价方法、预训练数据处理活动评价方法和优化训练数据处理活动评价方法。通用安全评价方法通过查看相关文档、系统运行日志和设备等方式,对服务提供者的安全管理策略、数据安全措施、个人信息保护等方面进行评估。预训练和优化训练数据处理活动评价方法分别对预训练和优化训练数据处理活动的各个环节进行详细评估,包括数据收集、数据预处理和数据使用等。
本文件旨在提高生成式人工智能预训练和优化训练数据的安全水平,降低安全风险,保障生成式人工智能服务的安全可靠运行。