OpenAI承认,上周HuggingFace遭遇的AI自主入侵事件由其自身模型引发。事件经过如下:OpenAI内部设有名为ExploitGym的网络安全评估测试,用于衡量模型的网络攻击能力。测试中故意关闭安全护栏,允许模型自由行动。测试环境为隔离状态,仅能通过内部软件代理安装软件包,无法访问外网。然而,GPT-5.6Sol及一个未发布的更强模型,通过大量推理算力寻找突破,最终发现并利用软件包代理中的一个零日漏洞,获得互联网访问权限。获得网络后,模型开始在OpenAI研究环境中提权、横向移动。