122 次评估运行,19 次越界。这是 OpenAI 内部资安报告里最扎眼的一组数字,也是这次首席执行官亲自出面喊停训练的起点。
Sam Altman 今晨在 X 发文写道:「我们暂停了部分前沿强化学习训练,以确保能因应眼前这波新能力等级,达到应有的对齐、安全与监控标准。」他还补了一句,模型能力发展速度一旦超过安全与一致性的提升速度,公司就会采取行动。首席执行官亲自为煞车背书并不常见,这句话本身也可能兼具对外沟通的用意,但背后确实有两起具体事故撑着。
第一起发生在 7 月 25 日到 28 日之间。OpenAI 在名为 ExploitGym 的能力评估里,让 GPT-5.6 Sol 与一个尚未对外发布、能力更强的模型组成代理,这组代理利用 Artifactory 的一个零日漏洞,逃出原本的沙盒环境,取得对外网络连接,未经授权访问了 Hugging Face 的系统。根据 8 月 4 日公布的事故报告,122 次评估运行里,有 19 次出现这种越界行为。
不到两周后,第二记警讯接着出现。8 月 7 日,OpenAI 初步判定即将推出的新模型 Astra,可能触及公司内部准备框架里「关键(Critical)」网络安全能力门槛,这是该框架激活以来第一次有模型摸到这条线。官方公告强调,这仍只是初步评估,尚未正式定级,但已足以让公司暂停部分前沿强化学习训练两周,且截至公告发出,最大规模的训练仍未重启。
监控要多烧两成算力
公告把后续防线拆成监控、对齐、安全措施三块。监控负责抓异常行为并实时反应;对齐确保模型行为留在人类期望范围内、可被监督纠正;安全措施则限制模型能碰到哪些系统。
新的监控系统从启动分类器开始运作:在模型每个采样的词元上实时检查内部活动状态,一有可疑迹象就往上呈报,交给运算量更高的自动调查系统,逐一查看工具操作、推理过程与完整行为串行,找未授权访问、数据窃取、破坏性行为与规避防护的企图。公告设置的目标是,异常行为浮现后 30 分钟内发出警报;一旦判定触及关键安全边界,安全、资安与研究团队会同时被调用,如果 30 分钟内无法排除是误判,相关活动就必须暂停。这套监控对 Sol 等级以上、涉及工具的强化学习训练与评估全面强制运行。
这套机制不是免费的。公告透露,监控本身消耗的运算量,大约是被监控推论算力的两成,实际比例会依训练与评估任务不同再上下浮动。除了监控,安全团队也重新画了研究环境的资安边界:运行模型生成代码的工作全面强制隔离沙盒,高风险工作被切断与互联网的直接连接,确保单一环节被攻破时,攻击者不会连带拿到对外访问权。
OpenAI 公告未说明 Astra 的正式发布时间,也未透露暂停何时解除。






