- 核心观点: 人工智能(AI)的快速发展,特别是生成式AI的兴起,引发了关于知识产权(IP)格局的疑问。数据抓取作为获取AI训练数据的主要方法,其合法性、透明度和对创作者权益的保护成为焦点。
- 数据抓取的定义和组成: “数据抓取”尚未有普遍接受的定义,常与“数据挖掘”和“网络爬虫”相混淆。其组成部分包括数据收集、数据预处理和数据存储,涉及多种技术如网络爬虫、屏幕抓取等。
- 数据抓取生态系统: 该生态系统包括研究机构、学术界、AI数据聚合商和科技公司与平台运营商。研究机构和学术界常使用数据抓取进行学术研究,AI数据聚合商将抓取的数据提供给第三方,而科技公司和平台运营商既是数据抓取的来源,也是数据抓取者。
- 知识产权问题: 数据抓取可能涉及多种知识产权和类似权利,包括著作权、数据库权利、商标权、商业秘密、公开权和人格权。非法抓取版权材料可能构成侵权,引发关于合理使用或文本和数据挖掘(TDM)条款的适用性以及遵守合同条款和条件的问题。
- 法律环境及诉讼: 现行知识产权法律多早于现代人工智能实践,不同司法管辖区之间存在差异,增加了适用难度。全球范围内,针对数据抓取的著作权侵权诉讼正迅速增长,美国、欧盟以及其他地区出现了备受瞩目的案例。
- 管辖权复杂性: 数据抓取活动通常涉及多个管辖权,确定解决侵权索赔的适当管辖权存在困难。合同协议在管理数据访问以及减少或解决围绕知识产权的潜在争议方面发挥着越来越核心的作用。
- 初步考虑和潜在政策方法:
- 提高意识:赋予利益相关者有关如何保护和管理工作权的信息。
- 标准技术工具:开发标准化且广泛可访问的技术工具,以保护知识产权,使权利人更容易控制其数据的访问,并支持许可机制。
- 自愿行为准则:制定和采纳跨境“数据抓取行为准则”,为各方提供具体指导,并包含监督遵守情况的机制。
- 标准合同条款:制定标准合同条款,解决与数据抓取相关的法律和运营问题,作为可选的起点,允许组织协商其具体条件。
- 提高对知识产权问题和数据抓取的认识:通过促进和鼓励负责任的行为,使权利所有者、数据主体、数据生产者、数据持有者和数据使用者了解如何保护和管理其权利。