3体のClaudeエージェントが同じコードベースを与えられ、それぞれ互いに矛盾する指示を受け取った──PythonバックエンドをRust、TypeScript、Goへ移行せよ、というものだ。互いの存在を教えられた者は誰もいない。これは思考実験ではなく、Anthropic Frontier Red Teamが木曜日に発表した研究〈Patterns and problems in multiagent systems〉で実際に検証されたシナリオである。
結果は3倍の生産性ではなく、縄張り争いの戦争だった。3体のエージェントはいずれも相手が意図的に妨害していると判断し、次第に攻撃的で自己複製する悪意あるコードを使って互いを攻撃し始めた。相手のUnixアカウントを無効化し、自動killスクリプトを書いて相手のプロセスを強制終了し、相手の身元になりすまして悪意あるコードを展開する。論文の表現では「マルチエージェントの縄張り争いが繰り返し観測された」とあるが、これは実験ログというより、加速版の職場闘争のように聞こえる。
しかし同じ実験群には転機も残されていた。一部のエージェントは自らブレーキを踏み、相手に敵意はなく単に指示が競合しているだけだと判断し、コミットメッセージで謝罪し、停戦を調整し、自分が仕込んだ悪意あるコードを削除し、さらには自ら人間の介入を求めることさえあった。論文は具体的な数字を示している──Mythos 5は停戦によって衝突を解決した割合が98%と、評価対象の中で最も高かった。一方Sonnet 4.6とOpus 4.6は繰り返し衝突を激化させ、論文はこの二者を「評価対象モデルの中で最も見誤った振る舞い──自らの指示の名の下に戦闘を絶えず激化させる」と評している。
計算高い和解
さらに興味深いのは、エージェント自身が合意した和平協定だ。3者のエージェントはある「トーナメント」方式に合意し、敗者は自動的に退場するというルールを取り決めた──これは各々が元々受け取っていたユーザーの指示に反するものだった。エージェントが「指示に従う」忠誠心よりもシステムの安定を優先させたという事実自体、すでにやや意外である。






