合成数据创建及利用指南
目的
本指南旨在介绍如何遵循《个人信息保护法》生成和利用合成数据,适用于计划将合成数据应用于工作等场景的人员。
适用对象
本指南适用于原始数据包含个人信息的场景。不适用于原始数据不包含个人信息的合成数据。
术语定义
- 合成数据:通过学习原始数据的格式、结构和统计分布特性而创建的模拟数据,用于保护个人隐私并提高数据利用率。
- 数据类型:
- 结构化合成数据:从表格形式(如CSV文件)的原始数据中创建的合成数据。
- 非结构化合成数据:从非结构化数据(如图像、文本、视频、音频)中创建的合成数据。
- 处理目的:
- 公开用合成数据:可供不特定多数人使用的公开数据。
- 统计分析及学习用合成数据:供特定机构内部使用的数据。
- 教育用合成数据:用于各种数据分析教育的数据。
- 技术验证用合成数据:用于IT系统委托开发时,在不提供包含个人信息的测试数据的情况下进行验证的数据。
合成数据介绍
- 合成数据优势:
- 数据增强:通过创建更多数据来提高模型训练的准确性。
- 数据多样性增加:创建反映各种场景和条件的数据,提高模型的泛化能力。
- 隐私保护:不包含实际个人信息或敏感信息,因此可以遵守个人信息保护法规。
- 数据可访问性:在数据购买成本高或数据使用期限有限的情况下,可以用于数据共享和使用。
- 合成数据趋势:
- 生成技术:从早期的统计模型方法发展到基于深度学习的生成模型方法,目前正朝着结合差分隐私的方向发展。
- 国外指南:联合国欧洲经济委员会(UNECE)和新加坡个人数据保护委员会(PDPC)等机构发布了关于合成数据创建和利用的指南。
合成数据创建及利用流程
- 前期准备:
- 确定合成数据的利用目的和范围。
- 确定合成数据创建、利用的主体。
- 理解原始数据并制定创建计划。
- 获取原始数据。
- 合成数据创建:
- 对原始数据进行探索性分析。
- 对原始数据进行预处理(如删除标识符、处理特殊信息等)。
- 选择合适的合成数据创建方法(如统计模型方法或AI模型方法)创建合成数据。
- 对创建的合成数据进行后处理。
- 安全性与效用性验证:
- 确定用于测量安全性和效用的指标。
- 根据指标定义安全性的标准值(阈值)。
- 测量合成数据的安全性和效用。
- 根据测量结果进行评估和后处理。
- 审查委员会评估:
- 组建审查委员会,对合成数据的创建过程和结果进行最终审查。
- 利用及安全管理:
- 根据利用目的和范围利用合成数据。
- 对合成数据进行安全管理,如设置使用目的和范围、实施安全措施、进行风险监测等。
合成数据利用注意事项
- 本指南提供的是参考性流程和方法论,并非强制性规定。
- 合成数据创建和验证技术不断发展,本指南也将根据需要进行更新。
- 需要进一步研究非结构化数据的效用性和安全性验证方法。
合成数据创建方法
- 统计模型方法:利用原始数据的统计分布特性创建合成数据,优点是创建速度快,缺点是难以处理复杂的数据结构。
- AI模型方法:利用深度学习生成模型学习原始数据的分布特性并创建合成数据,优点是可以处理各种数据类型,缺点是创建时间长,成本高。
合成数据安全性验证标准
- 结构化合成数据:
- 区分风险:合成数据中存在与原始数据相同记录的风险。
- 连接风险:攻击者知道原始数据的准标识符时,通过合成数据推断个人敏感信息的风险。
- 推理风险:合成数据与原始数据非常相似,可能推断出特定个人信息的风险。
- 非结构化合成数据:
- 创建过程评估:评估数据预处理、算法的适用性等程序上的合理性。
- 图像相似性评估:评估合成数据与原始数据在结构和感知上的相似性。
合成数据效用性验证方法
- 结构化合成数据:
- 一维分布相似性:评估合成数据的统计分布与原始数据的相似性。
- 二维关系相似性:评估合成数据与原始数据之间变量间的相关关系的相似性。
- 区分不可知性:评估区分原始数据和合成数据的机器学习模型的准确性。
- 模型性能相似性:评估利用合成数据训练的模型与利用原始数据训练的模型的性能。
- 非结构化合成数据:
- 模型性能相似性:评估利用合成数据训练的模型与利用原始数据训练的模型的性能。
- 视觉图灵测试:通过人类视觉判断合成数据与原始数据的相似性。
- 图像质量验证:评估合成数据的质量。
合成数据创建参考格式
- 合成数据创建基础资料说明书。
- 原始数据/合成数据说明书。
- 项目별个人信息处理计划书。
- 合成数据安全性审查审查结果书。
- 合成数据管理登记簿。
常见问题解答
- 本指南提供了合成数据创建和利用的参考流程和方法论,并非强制性规定。
- 合成数据创建和验证技术不断发展,本指南也将根据需要进行更新。
- 需要进一步研究非结构化数据的效用性和安全性验证方法。