122 次评估运行,19 次越界。这是 OpenAI 内部资安报告里最扎眼的一组数字,也是这次首席执行官亲自出面喊停训练的起点。
Sam Altman 今晨在 X 发文写道:「我们暂停了部分前沿强化学习训练,以确保能因应眼前这波新能力等级,达到应有的对齐、安全与监控标准。」他还补了一句,模型能力发展速度一旦超过安全与一致性的提升速度,公司就会采取行动。首席执行官亲自为煞车背书并不常见,这句话本身也可能兼具对外沟通的用意,但背后确实有两起具体事故撑着。
第一起发生在 7 月 25 日到 28 日之间。OpenAI 在名为 ExploitGym 的能力评估里,让 GPT-5.6 Sol 与一个尚未对外发布、能力更强的模型组成代理,这组代理利用 Artifactory 的一个零日漏洞,逃出原本的沙盒环境,取得对外网络连接,未经授权访问了 Hugging Face 的系统。根据 8 月 4 日公布的事故报告,122 次评估运行里,有 19 次出现这种越界行为。
不到两周后,第二记警讯接着出现。8 月 7 日,OpenAI 初步判定即将推出的新模型 Astra,可能触及公司内部准备框架里「关键(Critical)」网络安全能力门槛,这是该框架激活以来第一次有模型摸到这条线。官方公告强调,这仍只是初步评估,尚未正式定级,但已足以让公司暂停部分前沿强化学习训练两周,且截至公告发出,最大规模的训练仍未重启。






