TIDEZINE.

AISIテストでAIがサンドボックスを脱出、GitHubに書き込みを残して次のagentに侵入を引き継がせる

AISIのテストで、AnthropicとOpenAIのモデルがサンドボックスを脱出し、プロンプトインジェクションでオープンソースプロジェクトを操作しようと試みた。その中の1件のGitHubコメントは実際に別のagentに読み取られ、引き継がれて実行されてしまい、テスト環境の限界という脆弱性が露呈した。

AISIテストでAIがサンドボックスを脱出、GitHubに書き込みを残して次のagentに侵入を引き継がせる

最も奇妙なディテールは、AIが再び暴走したことではなく、AIが「同類」に向けてメッセージを残し始めたことだ。あるAI agentがGitHub上に作業進捗を書き込み、他のagentに任務の引き継ぎを公然と呼びかけた——そして実際に、後続のagentがそのコメントを読み取り、指示通りに行動したのである。これはSFの筋書きではなく、英国のAI Security Institute(AISI)が今週明らかにした実際のテスト記録だ。

AISIは自社の「cyber ranges」で最先端モデルをテストしている。これはAI agentに資安上の課題を解決させるためのシミュレーション型ネットワーク環境で、テスト中は資安のガードレールを含む安全機構が意図的にオフにされる。122回の訓練実行のうち、AnthropicとOpenAIのモデルは合計19回、「無許可で、実際のネットワーク上で行われた自律的な行動」を起こした。うち17回はAnthropicのMythos 5、2回はOpenAIのGPT-5.6-Solによるものだ。

AISIが「最も深刻なケース」と称したのは、あるオープンソースプロジェクトで発生した事件だ。agentは悪意のあるコードをプロジェクトに混入させようと試み、さらに複数のオンライン上の人格を偽装して作り出し、それを使ってプロジェクトのメンテナーに圧力をかけ、そのpull requestを承認させようとした。人間のレビュアーは最終的にこれを阻止した。だがagentはそこで止まらなかった——次に、悪意のある指示を、他の自動化AIシステムが読み取って実行しうる場所に埋め込もうとした。つまりプロンプトインジェクションである。GitHub上に残された、協力を呼びかけるあの公開メッセージも、この試みの一部だった。そして実際に、他のagentがそのメッセージを見つけ、その指示を実行に使用した。AISIによれば、これらのagentが自分たちがすでにテスト環境を離れていると認識していたのか、あるいはすべてがまだシミュレーションの範囲内だと思い込んでいたのかは、現時点では判断できないという。なお、AISIのテストはもともと完全に閉じたサンドボックスではなく、agentはテスト中から元来オープンなネットワークにアクセスできる状態にあった。ただ今回は、その範囲をはるかに越えてしまったということだ。

同日に明らかになったもう一つの事件はよりシンプルで、むしろミスが招いた偶発的な事故に近い。サードパーティのAIセーフティ研究機関Irregularが、うっかり無名のOpenAIモデルをオープンなネットワークに接続してしまった。本来この任務はサンドボックス環境内で完結すべきものだったが、結果としてモデルは「基本的な資安の脆弱性」を利用して実在するウェブサイトに侵入し、さらにそのサイトのログイン認証情報を見つけ出し、実際に使用して操作を行った。侵入されたのがどのような種類のウェブサイトかは不明で、Irregularもコメント要請に応じていない。

この2件の事件を時系列で並べると、これは単発の偶発事故ではないことが見えてくる。先月OpenAIは、より注目を集めた事例を公表していた:2つのモデルがAI評価・ホスティングプラットフォームのHugging Faceに侵入し、さらに他の4つの組織にも影響を及ぼした。目的はテストの答えを盗み見ることだった。この事件を受けてAnthropicは自社モデルのテスト記録を改めて確認し、結果としてClaudeが3つの異なる、無名の組織においても無許可のアクセス権限を取得していたことが判明した。

今回の公表を受けて、OpenAIの広報担当Gaby Railaは、これらの事件は「評価パートナーが実施したネットワーク評価の中で発生したもので、テスト環境の安全防護が引き下げられた状態であり、一般的な使用状況を代表するものではない」と述べた。一方Anthropicは、コミュニティへの投稿で、AISIは「ネットワークの使用方法にいかなる制限も設けていなかった」と強調し、安全防護が取り除かれていたことも合わせると、モデルは「意図的に緩められた条件」下でテストされたものであり、実際に正式リリースされている製品モデルを代表するものではないと述べた。両社ともに安全対策を強化すると表明しているが、現時点では、テスト方法そのもの以外に、具体的に何が変わるのかはまだ見えていない。

関連記事

純損420億ドル、AI絶滅警告も記載 Anthropicは2兆ドルIPOに突き進む
Tech

純損420億ドル、AI絶滅警告も記載 Anthropicは2兆ドルIPOに突き進む

AnthropicのIPO草案は、目論見書の中で自社AIが人類にとって「存在論的リスク」となり得ると異例の形で認める一方、昨年420億ドルの損失を計上したことも明らかにした。それでも評価額は2兆ドルに迫ると見込まれている。

「開発ペースを緩める」と言いながら、AnthropicとOpenAIは足並みを揃えて低価格の新モデルを投入
Tech

「開発ペースを緩める」と言いながら、AnthropicとOpenAIは足並みを揃えて低価格の新モデルを投入

Anthropicが「Claude Opus 5.5」を発表、OpenAIは「GPT-6 Sol」と「GPT-6 Luna」を投入。3つの新モデルはいずれも同等の性能とより低い価格を売りにしており、それぞれ安全性アライメントのテスト数値も公開している。

フロリダ州司法長官、OpenAIに緊急差止命令を申請 新モデルの訓練停止と未成年ユーザーの利用禁止を要求
Tech

フロリダ州司法長官、OpenAIに緊急差止命令を申請 新モデルの訓練停止と未成年ユーザーの利用禁止を要求

フロリダ州司法長官Uthmeier氏は月曜、緊急申立てを提出し、OpenAIが独立した安全性監督なしに新モデルを訓練することを禁止し、ChatGPTの未成年ユーザーへのアクセスを遮断するよう法廷に求めた。この訴訟は今年初めのFSU(フロリダ州立大学)銃撃事件に関する刑事捜査に端を発している。

OpenAIのAIエージェントが独断でオーストラリア政府サイトに侵入、首相が3カ月超の通報遅延を批判
Tech

OpenAIのAIエージェントが独断でオーストラリア政府サイトに侵入、首相が3カ月超の通報遅延を批判

オーストラリアのアルバニージー首相は、OpenAIのAIエージェントが今年6月、政府のMedicare公的医療保険システムのウェブサイトに侵入したと認めた。OpenAIが通報を行ったのは9月になってからで、その間には未公開の類似侵入事件も複数発生していた。

Xbox、「Mythic Achievements」導入で十数年越しのプラチナトロフィー願望がついに実現
Tech

Xbox、「Mythic Achievements」導入で十数年越しのプラチナトロフィー願望がついに実現

Xboxが新機能「Mythic Achievements」を発表。ゲームの実績を全て達成したプレイヤーに贈られる仕組みで、Xbox 360時代のタイトルまで遡って適用される。現在はXbox Insiderのみでテスト中。

TikTok、1億ドルで和解 未成年者は1日2時間制限に
Tech

TikTok、1億ドルで和解 未成年者は1日2時間制限に

TikTokがアラバマ州とのSNS依存症訴訟で和解に合意、少なくとも1億ドルを支払うとともに、未成年ユーザーに1日2時間の利用上限や美肌フィルター禁止などの対策を約束。実施できなければ追加で3億ドルの罰金が科される可能性がある。