生成式人工智能中使用个人数据的指导方针 2026年7月20日发布 目录 127 模型提供者 ...................................................................................9 系统部署者 ...................................................................................六、生成式人工智能利益相关者..........................................................11第一部分:引言与范围 .............................................................5 附加注意事项................................................................................10第四条 同意与通知义务 ..........................................................................8 系统提供者....................................................................................3 公开可用的例外..............................................................................4引言 ........................................................................................指南范围 ....................................................................................第十条 访问和更正义务 ..........................................................................第三部分:部署 - 生成式人工智能利益相关者的数据保护责任 ........................................... 11第二部分:发展——收集和使用个人信息以开发生成式人工智能模型 4第四部分:部署后 - 处理关于个人数据的个别请求 ......................................................................................... 16 第一部分:引言与范围 1 简介 1.1 个人数据保护条例2012年(《个人数据保护条例》,简称“PDPA”)规范了组织收集、使用和披露个人数据的方式,该方式共同承认个人保护其个人数据的权利以及组织为合理目的利用个人数据的需要。 1.2 本部分根据法案的目标,阐明了《个人资料(私隐)条例》(PDPA)如何适用于人工智能(“AI”)环境。个人资料保护委员会(“委员会”)发布的《关于在人工智能推荐和决策系统中使用个人资料的咨询指南》就以下方面提供了基础性指导:(i) 组织在人工智能系统开发、测试和监控中,可以根据PDPA依赖豁免同意(例如为业务改进或研究目的);(ii) 组织如何就其人工智能系统是否以及如何使用个人资料保持透明;以及(iii) 第三方服务提供者如何协助组织实施人工智能系统。 1.3 “生成式人工智能模型”是指那些表现出显著通用性、能够胜任广泛不同任务的模型,无论其市场投放方式如何,这些模型均能被集成到各种系统或应用中,其中也包括使用大规模自监督方式在大数据上训练的模型。“生成式人工智能系统”是指基于生成式人工智能模型的人工智能系统或应用,既可直接使用,也可用于集成到其他人工智能系统中。 1.4 这些咨询指南(《指南》)阐明了个人数据可在生成式人工智能模型和/或系统中如何使用。本指南建立在《关于在人工智能推荐和决策系统中使用个人数据的委员会咨询指南》和《关于个人信息保护法(PDPA)关键概念咨询指南》之上,并应与之一并阅读。本指南亦应始终与委员会颁布或适时可能颁布的任何其他相关指南一并阅读。 1.5 这些指南具有建议性质,对委员会或任何其他方不具有法律约束力,也不构成法律建议。它们既不以任何方式修改也不以任何方式补充所引用的任何法律的法律效力与解释,包括但不限于《个人资料(私隐)条例》及根据《个人资料(私隐)条例》颁布的任何附属法规。如存在任何不一致之处,《个人资料(私隐)条例》及任何附属法规的规定应优先于这些指南。这些指南不应 据解释,旨在限制或限制委员会对《个人数据保护条例》的行政和执行。 2 指南范围 2.1 该指南针对当前与生成式人工智能相关的部分关键数据保护问题提出建议。这些问题包括:(i) 为开发生成式人工智能模型而收集和使用个人数据;(ii) 在生成式人工智能全生命周期中分配数据保护责任;以及(iii) 处理个人就其个人数据处理用于生成式人工智能提出的请求。 2.2 本指南根据生成式人工智能生命周期的典型阶段进行组织,具体如下: 3 公开可用例外 3.1 开发生成式AI模型需要大量数据,包括在预训练和微调阶段。网络爬虫——一种自动提取大量在线数据的过程——是编译此类数据集的常用手段。当网络爬取的数据集包含个人数据时,组织可以考虑依赖“公开可用例外”来替代寻求同意。 3.2 此处指个人资料保护条例第一附表第二部分第1条,该条款允许机构在不经同意的情况下收集、使用或披露有关个人的个人资料。 公开可用的个人。公开可用的个人数据是指通常可被公众获取(即获取或访问几乎不受限制或不受限制)的个人数据,包括个人在向公众开放的场所或活动中出现时,可以通过合理预期的方式观察到其个人数据。2 3.3 当个人数据属于不受任何限制即可公开访问的在线数据时,组织可依据公开可用例外条款收集该数据以开发生成式人工智能模型。但这仍需符合合理人考量下,在具体情况下使用个人数据开发生成式人工智能模型是否恰当的判断标准。 3.4 然而,当个人数据构成置于数字屏障之后(或:被数字屏障所隔离的)在线数据时,组织机构必须在依赖公开例外(或:公开数据例外)之前,评估该数据是公开可用的。委员会认为,数字屏障是指任何在全部或部分上对数据访问构成实质性限制的技术性及/或财务性措施。数字屏障的例子包括: 付费墙(例如:固定收费、计量收费、动态收费)或订阅; b)c)(“APId)e)注册要求(例如,需要提供姓名、邮箱等信息才能注册的流程)用户姓名、电子邮件地址和联系方式;认证机制(例如密码、应用程序编程接口)")键、基于令牌的访问、一次性代码);基于位置或资格的访问控制(例如地理屏蔽器、年龄门);以及检测并限制或阻止自动化的工具、系统或配置阻止程序访问在线数据(例如速率限制、AI机器人拦截器、完全...)自动区分计算机与人类的图灵测试 3.5 数字鸿沟的存在并不默认阻止个人数据公开4,且具体情况和案件事实至关重要。在生成式人工智能的背景下,组织在进行评估时应考虑的相关因素包括: a) 数字壁垒的目的(例如,以实现数据变现);b) 数字壁垒的影响(例如,在线数据是否对公众普遍开放或仅限于特定群体); 一个组织如何恰当评估处于数字屏障之后的个人数据是否公开的示例: 一家科技公司正在通过网络抓取来训练其最新的生成式AI模型。它识别到一个包含个人数据的数据库集,该数据集仅对特定专业协会的成员可用。要注册账户,用户必须提供其会员资格或专业注册详情。 在这种情况下,该公司认为:(i) 注册要求旨在将数据访问权限制在特定一组人员;(ii) 个人数据无法从其他在线来源获取。据此,该公司得出结论,数据库中的个人数据很可能并非公开可用。 3.6 委员会认为,以下数据即使受到数字壁垒的限制,也属于公开数据,例如: 由公共机构管理的注册机构,旨在向公众普遍开放。这包括那些数据只有在付费后才能提供的注册机构,因为它们仍然可以被任何公众成员获取。 b) 允许在要求付费或订阅之前访问有限数量文章的新闻或媒体网站,因为付费墙充当的是盈利机制而非实质性的访问障碍;以及 c) 大型在线论坛,向任何人开放加入,但要求用户提供注册信息作为访问和参与的条件。此类要求并不复杂或繁琐,足以防止数据被普遍获取。 3.7 鼓励组织在对其数据的公共可用性存有不确定时,寻求委员会的指导。如果可以合理地论证,数字屏障后的个人数据并非公开可用,但组织 尽管其依赖公开例外,但该机构必须通过数据保护影响评估第5条或其他书面记录来解释其评估和理由。如果委员会要求该组织证明其依赖公开例外的理由,则必须提供该文件。 3.8 上述考虑同样适用于将个人数据在线公开的组织和/或个人。这些控制实体应意识到公开的数据可能受到网络爬虫的抓取。如果他们不打算或未获得同意让他们的数据被网络爬虫抓取,他们应实施适当的数字屏障。控制实体可以寻求委员会关于其数字屏障充分性的指导。 3.9 为避免歧义,公开可用例外条款的适用性以及遵守个人数据保护法案(PDPA)的要求,与组织尊重在线使用条款或许可协议的合同义务,以及一般法律下的任何要求(包括知识产权法和刑法)是不同的。6 一家数据分析公司识别了一个大型在线论坛作为训练数据源。该公司评估认为,论坛上的个人数据是公开可用的,因为用户只需创建用户名并提供电子邮件地址即可访问。 然而,该论坛的服务条款明确禁止网络爬虫,并直接引导希望大规模访问论坛数据的商家使用官方API。API访问还须经过申请和审批流程,该流程包括申请人资格审查和接受使用合同条款。 在这种情况下,尽管个人数据是公开可用的,公司仍应遵守其合同义务。它应与论坛运营商合作,通过官方API根据服务条款获取访问权限。 第四条 同意与通知义务 4.1 另一个用于开发生成式人工智能模型的关键数据来源是个体向组织提供的个人信息,或是个体使用组织产品或服务过程中创建的个人信息(“用户数据”)。一些组织内部使用用户数据开展模型开发,而另一些组织则将用户数据披露给数据中介机构用于该目的。 4.2 作为起点,组织可以考虑依据“同意义务”7 的例外情况或推定同意来使用用户数据以开发生成式人工智能模型。然而,如果组织认定这些替代方案不适用,则必须获得同意。8 同意义务通过“通知义务”得到补充,该义务要求在寻求个人就其个人数据某项预期用途的同意时,必须通知个人该用途。9 此外,《个人数据保护法》第20(1)条要求组织应告知个人以下内容: 收集、使用或披露其个人数据的目的,在收集个人数据之时或之前;以及 b) 任何其他在个人未根据第 (a) 款事先知情的情况下使用或披露其个人数据的目的,在使用或披露该个人数据于该目的之前。 组织在何种情况下应就用户数据的用途寻求新的同意: 一家服装公司将自己重新定位为生成式人工智能模型的开发者,并打算使用其用户数据用于训练,以获取商业优势。这些数据包括客户姓名、交易历史和纵向行为数据。该公司考虑是否可以依据其开发新产品或服务为由,依赖业务改进例外。但该公司认定,使用其用户数据中的个人信息进行生成式人工智能开发,与过去商业活动存在重大偏离,以至于一个理性的人不会认为这种使用是恰当的。 在这种情况下,恰当的做法是获得新的同意。 4.3 目前,组织正使用多种机制来告知用户并获取其同意,以使用用户数据来开发生成式人工智能模型,包括隐私政策、服务条款、产品内通知和集中式资源中心。通过这些机制提供的通知通常有两种形式。第一种是关于处理目的的一般性声明。这些声明可能会引用使用个人数据进行“新产品开发”,而不会具体说明人工智能或生成式。 人工智能模型开发。这些被