从目前公开的行业统计和头部厂商披露信息来看,AI大模型的训练数据量整体呈现持续快速增长的态势,相关情况可以从几个维度梳理:
- 整体增长趋势
过去15年间,AI模型训练数据集的Token规模年增长率达到250%~260%,即便到近年增长也没有停滞,合成数据、新增垂类标注数据都在持续推动训练Token规模走高,目前大模型训练数据量已经普遍从早年的15万亿Tokens提升到30万亿以上的水平 【1】 【2】 【3】 。
- 不同梯队模型的典型数据量级
- 开源普通大模型:常见的训练数据量在10-15万亿Tokens,这也是目前公开可获取、完成高质量清洗的网络数据的典型量级 【3】 。
- 国内头部厂商代表:阿里通义千问系列的训练数据规模已经从早期的18万亿Tokens提升至最新Qwen3版本的36万亿Tokens,覆盖119种语言和方言,还通过领域专家模型合成了大量数学、代码类专项数据 【3】 【13】 。
- 海外头部厂商代表:Meta的Llama 4 Scout引入了部分社交数据,总训练数据量约达40万亿Tokens;谷歌Gemini 3 Pro的数据集覆盖多模态类型,包含公开爬虫数据、商业许可数据、用户交互数据以及AI生成合成数据等多类来源;xAI的Grok系列最新版本训练数据量也达到了7.95万亿Tokens的水平 【3】 【10】 【9】 。行业普遍认为OpenAI、Google这类头部厂商的核心模型实际训练规模,会高于对外公开的口径数值 【3】 。
- 可用于训练的潜在数据存量
目前常用的开放爬虫数据库Common Crawl的有效Token中位数约为130万亿,公开索引网络的总Token量约510万亿,算上全网非公开的私人数据之后,全网文本类Token总存量可达3100万亿,后续训练数据规模还有进一步扩容的空间 【7】 。
- 早期经典模型的参考量级
早年的GPT-3完成训练时用到的子词总数约5000亿,训练过程中实际完成了3000亿子词的迭代,当时还会针对不同质量的语料设置差异化采样权重,优先保障高质量数据的训练轮次 【15】 。
【1】 【2】 【3】 【13】 【10】 【9】 【7】 【15】