Meta发布开源大模型Llama3,提升开源大模型能力。Llama3在多个关键的基准测试中性能优于业界先进同类模型,支持8K长文本,改进的tokenizer具有128K token的词汇量,可实现更好的性能。Llama3的主要亮点包括:基于超过15T token训练,支持8K长文本,改进的tokenizer具有128K token的词汇量,可实现更好的性能;在大量重要基准中均具有最先进性能;新能力包括增强的推理和代码能力;训练效率比Llama 2高3倍;带有 Llama Guard 2、Code Shield和CyberSec Eval2的新版信任和安全工具。Llama3在训练数据集上有明显提升:Llama 3使用超过15T的token进行了预训练,这些 token都是从公开来源收集的。总体上讲,Llama3的训练数据集是 Llama 2使用的数据集的七倍多,并且包含四倍多的代码。为了为即将到来的多语言用例做好准备,超过5%的Llama3预训练数据集由涵盖30多种语言的高质量非英语数据组成。Llama3在预训练阶段也有更多改善:在Llama3的开发过程中,Meta 对扩展行为进行了一些新的观察。例如,虽然8B参数模型的 Chinchilla最佳训练计算量对应约200B token,但Meta发现在对多达15T token进行训练后,8B和70B参数的模型都继续以对数线性的方式提升性能。Llama3预训练是在H100-80GB类型的硬件(TDP为 700W)上累计770万个GPU小时的计算。Meta 还极大地改进了硬件可靠性和静默数据损坏检测机制,并且开发了新的可扩展存储系统,以减少检查点和回滚的开销。这些改进使总体有效训练时间超过95%,使Llama3的训练效率比Llama2提高了约三倍。展望未来,最大的Llama3参数将超过400B,目前仍在训练中,但在接下来的几个月中陆续发布,新功能包括多模态、多语言对话能力、更长的上下文窗口以及更强的整体能力。