商务部邀请乔治敦大学安全和新兴技术中心(CSET)就人工智能和开放政府数据资产信息请求提供回应。CSET,作为乔治敦大学的政策研究组织,专注于数据分析以评估新兴技术的安全影响,特别是人工智能、网络安全和生物技术领域。
主要回应要点:
-
支持提高公共数据的可访问性、质量和透明度:
- 鼓励使用现有平台、论坛和传播实践(如GitHub、Zenodo)。
- 强调清晰、全面的数据文档(如数据卡片)的重要性。
- 推荐将数据资产与现有工具和数据集保持一致,例如使用开放式组织标识和现有职业代码(ROR、SOC)。
-
数据传播标准:
- 机器可读性:确保数据集和元数据便于AI理解和人类阅读。
- 数据质量:明确数据点的含义、计算方法等非显而易见的信息。
- 数据集局限性:明确数据集未涵盖的内容和潜在的误解记录。
- 数据格式:提供批量下载的CSV或JSON文件,包含标准、开源或非专有实体标识符和职业代码。
- 隐私保护:考虑原始数据和派生数据的隐私保护,必要时应要求数据经过适当的匿名化或隐私保护处理。
-
数据发布和许可证:
- 商务部应在开放许可证下发布数据,支持广泛、公平和开放访问。
- 考虑在许可证下发布数据,允许AI使用,可能指定特定的可接受或不可接受用途。
- 通过数据资产的集中管理,增加活动和可用性,如通过GitHub或Zenodo共享。
-
数据可访问性和检索:
- 提供非PDF格式的数据,优先为聚合数据提供可下载的CSV数据集。
- 解决数据质量问题,如日期和国家/地区的字段、实体列表修改反映方式。
- 集中的数据存取网站可提高网络可抓取性,减少跨机构的数据跟踪工作量。
-
伙伴关系和数据质量:
- 通过挑战、奖品或黑客马拉松等合作方式提高数据质量和可见性。
- 合作伙伴可以基于挑战成果进行研究,增强对商业数据有用性的认知。
-
数据伦理与责任:
- 确保数据集的公平性和代表性,避免数据偏见。
- 记录数据集的来源、修改和维护,提供透明度。
- 在GitHub存储库中存储数据文档和数据,便于问题追踪和沟通。
通过上述策略,商务部旨在优化其开放政府数据资产的管理和使用,促进AI应用的发展,同时保障数据的隐私和伦理考量。