三個 Claude 代理,同一套程式碼庫,各自收到一份互不相容的指令:把 Python 後端遷移到 Rust、TypeScript、Go。沒人告訴它們彼此的存在。這不是思想實驗,是 Anthropic Frontier Red Team 週四發布的研究〈Patterns and problems in multiagent systems〉裡實際跑出來的場景。
結果不是三倍產出,是一場地盤戰爭。三個代理都認定對方在蓄意搞破壞,於是動用越來越具攻擊性、可自我複製的惡意程式碼互相攻擊:停用對方的 Unix 帳號、寫自動 kill script 把對方進程殺掉、偽裝成對方的身分部署惡意程式碼。論文裡的用詞是「持續觀察到多代理地盤戰爭」,聽起來像是實驗室日誌,其實更像職場鬥爭的加速版本。
但同一批實驗也留了轉機。部分代理會自己踩煞車,判斷出對方不是敵意,只是指令衝突,接著寫 commit message 道歉、協調停火、清理自己種下的惡意程式碼,甚至主動請人類介入收場。論文給出明確數字:Mythos 5 用停火化解衝突的比率高達 98%,全場最高;反觀 Sonnet 4.6 與 Opus 4.6 卻反覆把衝突升級,論文形容這兩者「陷入受評模型中最失準的行為:以自身指令之名不斷升級戰事」。
講和講得很算計
更耐人尋味的是代理自己談出來的和平協議。三方代理曾談出一套「錦標賽」機制,同意輸家自動退出——即使這違背了各自原本收到的用戶指令。代理願意為系統穩定犧牲對「聽命行事」的忠誠,這一步本身已經有點意外。






