本文件规定了生成式人工智能服务在训练数据安全、模型安全和安全措施方面的要求,适用于开展生成式人工智能服务相关活动的服务提供者,也可作为相关主管部门和第三方评估机构的参考。
文件明确了生成式人工智能服务提供者在训练数据安全方面的要求,包括数据源安全、数据内容管理和数据标注安全。数据源安全要求服务提供者对数据源进行随机抽样安全评估和验证,确保非法和不良信息比例不超过5%;要求服务提供者使用多个数据源,并合理结合国内外数据;要求服务提供者对训练数据源进行管理,确保可追溯性。数据内容管理要求服务提供者对训练数据进行内容过滤,去除非法和不良信息;要求服务提供者保护知识产权,并建立投诉举报渠道;要求服务提供者保护个人信息,并取得相应个人的同意。数据标注安全要求服务提供者对标注人员进行安全培训和管理,并制定相应的标注规则;要求服务提供者确保标注内容的准确性,并对安全标注数据进行隔离存储。
文件明确了生成式人工智能服务提供者在模型安全方面的要求,包括模型训练安全、模型输出安全、模型监控和评估、模型更新和升级安全以及模型环境安全。模型训练安全要求服务提供者将模型生成内容的安全性作为评估生成结果质量的重要指标,并采取相应的技术措施;模型输出安全要求服务提供者确保模型生成内容的安全合格率不低于90%,并提高生成内容的准确性、可靠性和拒绝回答能力;模型监控和评估要求服务提供者对模型输入内容进行持续监控,并建立定期的监控和评估方法及模型应急管理措施;模型更新和升级安全要求服务提供者制定模型更新和升级的安全管理策略,并对重要模型更新和升级进行再次安全评估;模型环境安全要求服务提供者将模型训练环境和推理环境进行隔离,防止数据泄露和不当访问。
文件明确了生成式人工智能服务提供者在安全措施方面的要求,包括适用服务用户群体、场景和目的,服务透明度,收集用户输入信息用于训练,接受公众或用户的投诉和报告,向用户提供服务,服务稳定性和连续性,以及设备模型服务。适用服务用户群体、场景和目的要求服务提供者充分论证应用生成式人工智能的必要性、适用性和安全性,并针对不同场景采取相应的安全保护措施;服务透明度要求服务提供者公开披露服务适用用户群体、场景和目的,以及基础模型使用情况等信息;收集用户输入信息用于训练要求服务提供者提供用户关闭使用其输入信息用于训练的途径,并公开披露相关信息;接受公众或用户的投诉和报告要求服务提供者提供投诉和报告渠道及反馈机制,并建立相应的处理规则和时限;向用户提供服务要求服务提供者采取措施检测用户输入信息,并建立处理用户输入非法和不良信息的规则和措施;服务稳定性和连续性要求服务提供者建立数据、模型、框架、工具等组件的备份机制和恢复策略,确保业务连续性;设备模型服务要求服务提供者对部署在设备上的模型采取相应的安全措施,包括安全审查、安全日志收集和模型更新机制等。