OpenAI发布了o1-preview和o1-mini两个版本的模型,其中o1-preview推理能力更强,o1-mini速度更快且价格便宜80%。GPQA diamond测试中,o1的表现超过了博士学位的人类专家。o1通过强化学习改进CoT(Chain of Thoughts)过程,不断分解问题、纠错和尝试其他解决办法,显著提升推理能力。但o1的内部CoT过程大幅提升推理算力要求,导致其提问次数限制更严格、定价更高。
关键数据与表现:
- GPQA diamond测试:o1表现优于GPT-4o,超过博士学位人类专家。
- 推理能力:o1在数学、编程和科学问题中表现最好,写作任务中表现接近GPT-4o。
- CoT过程:o1在尝试解决问题时会使用CoT,通过强化学习不断改进。
- 定价与限制:o1-preview/o1-mini每周消息条数限制为30/50条,输入定价$3/1M tokens,输出定价$12/1M tokens;较GPT-4o定价更高。
研究结论:
- o1在推理能力上的提升有助于解决复杂逻辑问题,将进一步加速相关应用落地。
- 强化学习+CoT或成为模型迭代的新范式,挑战传统Scaling Law的结论。
- 推理算力需求或将攀升,对算力行业提出更高要求。
风险提示:
- AI技术落地不及预期、数据更新不及时、安全风险等。