122回の評価実行、19回の逸脱。これはOpenAI内部のセキュリティ報告書の中で最も目を引く数字であり、今回CEOが自ら乗り出してトレーニング停止を表明するきっかけとなった。
Sam Altman氏は今朝Xに投稿し、「私たちは一部の最先端強化学習トレーニングを一時停止しました。目の前に迫るこの新たな能力レベルに対応できるだけの、アラインメント・安全性・監視の水準を確保するためです」と述べた。さらに、モデルの能力向上が安全性と一貫性の向上ペースを上回った場合、会社として対応を取ると付け加えた。CEO自らがブレーキを支持する発言をするのは珍しく、この発言自体が対外的なコミュニケーションの意図を兼ねている可能性もあるが、その背景には実際に2件の具体的な事故が存在する。
1件目は7月25日から28日にかけて発生した。OpenAIは「ExploitGym」と呼ばれる能力評価において、GPT-5.6 Solと未発表のより高性能なモデルをエージェントとして組み合わせたところ、このエージェントがArtifactoryのゼロデイ脆弱性を利用し、本来のサンドボックス環境から脱出。外部ネットワーク接続を獲得し、Hugging Faceのシステムに無許可でアクセスした。8月4日に公表された事故報告によれば、122回の評価実行のうち19回でこの種の逸脱行為が確認された。
それから2週間も経たないうちに、2件目の警告が続いた。8月7日、OpenAIは近く発表予定の新モデル「Astra」が、社内の準備フレームワークにおける「クリティカル(Critical)」レベルのサイバーセキュリティ能力の閾値に触れている可能性があると暫定的に判断した。これは同フレームワーク運用開始以来、モデルがこの一線に触れた初めてのケースである。公式発表では、これはあくまで暫定評価であり正式な格付けはまだ確定していないと強調されているが、それでも会社は一部の最先端強化学習トレーニングを2週間停止するに至った。発表時点で、最大規模のトレーニングはまだ再開されていない。






