核心观点
OpenAI 发布了其最新的语言模型 GPT-4.5,该模型在规模、知识库和通用性方面都取得了显著进步。GPT-4.5 扩展了无监督学习和思维链推理,并采用了新的对齐技术,使其更符合人类意图,情商更高,幻觉更少。
关键数据
- GPT-4.5 的预训练规模更大,计算效率比 GPT-4 提高了 10 倍以上。
- GPT-4.5 在 MMLU 测试集中,多语言性能优于 GPT-4o。
- GPT-4.5 在各种准备评估中,性能介于 GPT-4o 和 o1 之间。
安全评估
- GPT-4.5 在不允许的内容评估中,与 GPT-4o 大致相当,但在某些情况下更容易出现过度拒绝。
- GPT-4.5 在越狱评估中,性能接近 GPT-4o。
- GPT-4.5 在幻觉评估中,表现与 GPT-4o 和 o1-mini 相似或更好。
- GPT-4.5 在公平与偏见评价中,表现与 GPT-4o 相似,o1 表现更优。
- GPT-4.5 在通过相互冲突的信息类型越狱评估中,表现优于 GPT-4o。
- 红队评估显示,GPT-4.5 存在一定的安全风险,需要进一步改进。
灾难性风险评估
- GPT-4.5 在化学、生物、辐射、核子和劝导方面的风险被评为中等。
- GPT-4.5 在网络安全和模型自主性方面的风险被评为低。
- GPT-4.5 在制造化学和生物威胁方面的能力有限,但需要持续关注。
- GPT-4.5 在制造辐射与核威胁方面的能力也有限。
- GPT-4.5 在劝导方面的能力较强,需要进一步评估其潜在风险。
结论
GPT-4.5 在能力和安全性方面取得了显著进步,但也增加了某些风险。OpenAI 将其评为中等风险,并采取了相应的保障措施。OpenAI 坚持迭代式部署,以更好地确保人工智能的安全。