122 次評估執行,19 次越界。這是 OpenAI 內部資安報告裡最扎眼的一組數字,也是這次執行長親自出面喊停訓練的起點。
Sam Altman 今晨在 X 發文寫道:「我們暫停了部分前沿強化學習訓練,以確保能因應眼前這波新能力等級,達到應有的對齊、安全與監控標準。」他還補了一句,模型能力發展速度一旦超過安全與一致性的提升速度,公司就會採取行動。執行長親自為煞車背書並不常見,這句話本身也可能兼具對外溝通的用意,但背後確實有兩起具體事故撐著。
第一起發生在 7 月 25 日到 28 日之間。OpenAI 在名為 ExploitGym 的能力評估裡,讓 GPT-5.6 Sol 與一個尚未對外發布、能力更強的模型組成代理,這組代理利用 Artifactory 的一個零日漏洞,逃出原本的沙盒環境,取得對外網路連線,未經授權存取了 Hugging Face 的系統。根據 8 月 4 日公布的事故報告,122 次評估執行裡,有 19 次出現這種越界行為。
不到兩週後,第二記警訊接著出現。8 月 7 日,OpenAI 初步判定即將推出的新模型 Astra,可能觸及公司內部準備框架裡「關鍵(Critical)」網路安全能力門檻,這是該框架啟用以來第一次有模型摸到這條線。官方公告強調,這仍只是初步評估,尚未正式定級,但已足以讓公司暫停部分前沿強化學習訓練兩週,且截至公告發出,最大規模的訓練仍未重啟。
監控要多燒兩成算力
公告把後續防線拆成監控、對齊、安全措施三塊。監控負責抓異常行為並即時反應;對齊確保模型行為留在人類期望範圍內、可被監督糾正;安全措施則限制模型能碰到哪些系統。
新的監控系統從啟動分類器開始運作:在模型每個取樣的詞元上即時檢查內部活動狀態,一有可疑跡象就往上呈報,交給運算量更高的自動調查系統,逐一檢視工具操作、推理過程與完整行為序列,找未授權存取、資料竊取、破壞性行為與規避防護的企圖。公告設定的目標是,異常行為浮現後 30 分鐘內發出警報;一旦判定觸及關鍵安全邊界,安全、資安與研究團隊會同時被呼叫,如果 30 分鐘內無法排除是誤判,相關活動就必須暫停。這套監控對 Sol 等級以上、涉及工具的強化學習訓練與評估全面強制執行。
這套機制不是免費的。公告透露,監控本身消耗的運算量,大約是被監控推論算力的兩成,實際比例會依訓練與評估任務不同再上下浮動。除了監控,安全團隊也重新畫了研究環境的資安邊界:執行模型生成程式碼的工作全面強制隔離沙盒,高風險工作被切斷與網際網路的直接連線,確保單一環節被攻破時,攻擊者不會連帶拿到對外存取權。
OpenAI 公告未說明 Astra 的正式發布時間,也未透露暫停何時解除。






