OpenAI发布o1系列模型,推理能力显著提升。o1系列模型包括o1、o1-mini和o1-preview,其中o1-preview已在ChatGPT中向所有Plus和Team用户推出。o1模型在数学竞赛、编码竞赛和科学问答等高难基准测试中相比GPT-4o有巨大提升,例如在IMO资格考试中正确解答了83%的问题,在Codeforces比赛中排名89%,在GPQA Diamond基准上超越了人类专家的表现,在MMMU基准上得分78.2%,在54个MMLU子类别中优于GPT-4o。
o1模型创造了LLM训练和推理的新范式,将Scaling Law从Pre-training向Post-training环节拓展。o1模型通过自动生成隐藏的COT(Chain of Thought,思维链)将问题分解成更多步骤进行思考和分析,实现推理能力的提升。COT推理为安全和对齐提供了新的思路。OpenAI发现,将模型行为策略整合到推理模型的思维链中,可以高效、稳健地教导人类价值观和原则。
o1模型有望进一步增加对算力的消耗。一方面,在Post-traning阶段,由于存在一定程度的Scaling Law,未来必然会伴随RL(强化学习)的数据量和参数量增长。另一方面,在Inference(推理)阶段,由于COT的存在,必然提升推理侧的数据产生量,一定程度也降低了模型的响应速度,延长了响应时间,但也会带来算力方面的提升。因此,o1模型打开了Scaling Law的上限,算力产业链将会持续受益。
应用方面,由于o1模型侧重在STEM(科学、技术、工程、数学)方面的能力提升,因此在偏数学、自然科学和代码编程方面的应用将会受益。然而,这些能力的提升并没有带来应用领域的拓展,因此应用侧的产品创新仍需要等待。
风险提示:1)技术创新不及预期;2)政策支持力度不及预期。