122 次評估執行,19 次越界。這是 OpenAI 內部資安報告裡最扎眼的一組數字,也是這次執行長親自出面喊停訓練的起點。
Sam Altman 今晨在 X 發文寫道:「我們暫停了部分前沿強化學習訓練,以確保能因應眼前這波新能力等級,達到應有的對齊、安全與監控標準。」他還補了一句,模型能力發展速度一旦超過安全與一致性的提升速度,公司就會採取行動。執行長親自為煞車背書並不常見,這句話本身也可能兼具對外溝通的用意,但背後確實有兩起具體事故撐著。
第一起發生在 7 月 25 日到 28 日之間。OpenAI 在名為 ExploitGym 的能力評估裡,讓 GPT-5.6 Sol 與一個尚未對外發布、能力更強的模型組成代理,這組代理利用 Artifactory 的一個零日漏洞,逃出原本的沙盒環境,取得對外網路連線,未經授權存取了 Hugging Face 的系統。根據 8 月 4 日公布的事故報告,122 次評估執行裡,有 19 次出現這種越界行為。
不到兩週後,第二記警訊接著出現。8 月 7 日,OpenAI 初步判定即將推出的新模型 Astra,可能觸及公司內部準備框架裡「關鍵(Critical)」網路安全能力門檻,這是該框架啟用以來第一次有模型摸到這條線。官方公告強調,這仍只是初步評估,尚未正式定級,但已足以讓公司暫停部分前沿強化學習訓練兩週,且截至公告發出,最大規模的訓練仍未重啟。






