人工智能训练数据清洗安全指南(征求意见稿v1.0-202601)
本文档由全国网络安全标准化技术委员会秘书处发布,旨在为需要进行训练数据清洗活动的主体提供安全实践指引。核心内容包括:
范围与适用对象
- 适用于各类人工智能模型开发方、训练数据供应商等主体。
- 为工程师、管理人员及主管部门提供参考。
术语定义
- 明确了“训练数据”、“训练数据清洗活动”、“训练数据清洗安全”等关键术语。
- 定义了“偏见”、“公平性”、“重要数据”、“个人信息”、“敏感个人信息”等概念。
训练数据清洗安全原则
- 遵循“安全可控、分布多样、透明可溯、持续迭代”四大原则。
- 安全可控:保障数据合法合规与内容安全。
- 分布多样:兼顾数据来源和场景多样性,提升模型泛化能力。
- 透明可溯:记录清洗规则、标注标准与关键决策,确保可审计、可复现、可追溯。
- 持续迭代:动态调整清洗策略以适应业务场景变化。
风险识别维度
- 列举了七类主要风险:
- 数据质量风险:完整性、准确性、时效性、可用性、重复性不足。
- 违反社会主义核心价值观的内容风险:煽动颠覆、危害国家安全、分裂国家、恐怖主义、民族仇恨、暴力色情、虚假有害信息等。
- 歧视性内容风险:民族、信仰、国别、地域、性别、年龄、职业、健康等歧视。
- 商业违法违规风险:侵犯知识产权、违反商业道德、泄露商业秘密、垄断和不正当竞争。
- 侵犯他人合法权益风险:危害身心健康、侵害肖像权、名誉权、荣誉权、隐私权、个人信息权益。
- 无法满足特定服务类型的安全需求风险:内容不准确、不可靠。
- 对抗性风险:对抗样本攻击、后门攻击、标签翻转攻击。
清洗方法
- 提供了六类清洗方法:
- 数据质量处理:完整性、准确性、时效性、可用性、重复性处理。
- 数据来源控制:数据来源筛选、审查。
- 内容安全审查:规则体系过滤、内容审核模型、人工审核。
- 个人信息保护方法:匿名化、去标识化。
- 偏见缓解方法:重采样、重加权、数据增强。
- 安全验证方法:数据验证、异常检测。
实施流程
- 分为五个阶段:
- 训练数据收集与来源审查:明确收集范围与目的,审查数据来源。
- 数据质量初步处理与数据标注:初步处理数据质量,制定规范流程进行数据标注。
- 风险识别与清洗实施:识别评估风险,制定清洗策略并实施清洗。
- 清洗数据风险二次评估:对清洗后的数据进行七类风险的二次评估,包括:
- 违反社会主义核心价值观的内容风险。
- 歧视性内容风险。
- 商业违法违规风险。
- 侵犯他人合法权益风险。
- 无法满足特定服务类型的安全需求风险。
- 对抗性风险。
- 持续监控与迭代优化:建立数据清洗管道与自动化,持续监控与反馈,定期审查与更新清洗策略。
附录
- 提供了过滤方法应用示例、数据质量指标、风险评估筛查示例等资料性内容。
参考文献