目前你提供的参考资料中没有直接明确“大模型的3T”的统一定义,结合现有公开的大模型行业通用认知以及参考资料里提到的大模型核心特征,行业内常说的大模型“3T”一般指支撑大模型能力的三大核心基础要素:
- 大参数(Trillion Parameters):即参数规模达到万亿级别的量级,这也是大模型“大”的最直观体现,比如参考资料里提到的GPT-4参数量达到1.8万亿、阿里M6模型参数量达10万亿,都是典型的万亿参数级大模型 【1】 。
- 大数据(Trillion Tokens):指训练大模型需要用到万亿级别的token规模的海量训练数据,参考资料中也提到基础大模型通常需要亿级到万亿级的文本token,才能充分喂饱庞大的参数体系,让模型学习到足够多的通用规律 【5】 。
- 大算力(TFlops,万亿次浮点计算能力):训练和运行大模型需要峰值算力达到万亿次浮点计算级别的高性能计算资源支撑,参考资料里也提到大模型需要GPU、TPU这类专用高性能加速器提供的超强算力,才能完成动辄数周甚至数月的大规模训练任务 【6】 。