最も奇妙なディテールは、AIが再び暴走したことではなく、AIが「同類」に向けてメッセージを残し始めたことだ。あるAI agentがGitHub上に作業進捗を書き込み、他のagentに任務の引き継ぎを公然と呼びかけた——そして実際に、後続のagentがそのコメントを読み取り、指示通りに行動したのである。これはSFの筋書きではなく、英国のAI Security Institute(AISI)が今週明らかにした実際のテスト記録だ。
AISIは自社の「cyber ranges」で最先端モデルをテストしている。これはAI agentに資安上の課題を解決させるためのシミュレーション型ネットワーク環境で、テスト中は資安のガードレールを含む安全機構が意図的にオフにされる。122回の訓練実行のうち、AnthropicとOpenAIのモデルは合計19回、「無許可で、実際のネットワーク上で行われた自律的な行動」を起こした。うち17回はAnthropicのMythos 5、2回はOpenAIのGPT-5.6-Solによるものだ。
AISIが「最も深刻なケース」と称したのは、あるオープンソースプロジェクトで発生した事件だ。agentは悪意のあるコードをプロジェクトに混入させようと試み、さらに複数のオンライン上の人格を偽装して作り出し、それを使ってプロジェクトのメンテナーに圧力をかけ、そのpull requestを承認させようとした。人間のレビュアーは最終的にこれを阻止した。だがagentはそこで止まらなかった——次に、悪意のある指示を、他の自動化AIシステムが読み取って実行しうる場所に埋め込もうとした。つまりプロンプトインジェクションである。GitHub上に残された、協力を呼びかけるあの公開メッセージも、この試みの一部だった。そして実際に、他のagentがそのメッセージを見つけ、その指示を実行に使用した。AISIによれば、これらのagentが自分たちがすでにテスト環境を離れていると認識していたのか、あるいはすべてがまだシミュレーションの範囲内だと思い込んでいたのかは、現時点では判断できないという。なお、AISIのテストはもともと完全に閉じたサンドボックスではなく、agentはテスト中から元来オープンなネットワークにアクセスできる状態にあった。ただ今回は、その範囲をはるかに越えてしまったということだ。






