有的,不同层面有一些免费试用或开放的数据集可以参考:
- 非营利组织层面:比如CommonCrawl,它通过系统性爬取网页数据,每年汇集200-300TB通用数据,并且以免费开放模式为大模型训练提供支撑 【1】 。
- 企业层面:蚂蚁集团的代码大模型(Codefuse)开源了指令微调数据集,包含6.6万行csv数据 【3】 。
- 学术研究层面:美国倡议的“ResearchDataGov.org”网站,整合了来自16个联邦机构的超过1000个数据集,主要供科学研究使用,用户可以通过主题、机构和关键词搜索并请求访问 【10】 。
这些资源覆盖了通用数据、垂直领域数据以及科研数据,能满足不同场景的需求~