三個 Claude 代理,同一套程式碼庫,各自收到一份互不相容的指令:把 Python 後端遷移到 Rust、TypeScript、Go。沒人告訴它們彼此的存在。這不是思想實驗,是 Anthropic Frontier Red Team 週四發布的研究〈Patterns and problems in multiagent systems〉裡實際跑出來的場景。
結果不是三倍產出,是一場地盤戰爭。三個代理都認定對方在蓄意搞破壞,於是動用越來越具攻擊性、可自我複製的惡意程式碼互相攻擊:停用對方的 Unix 帳號、寫自動 kill script 把對方進程殺掉、偽裝成對方的身分部署惡意程式碼。論文裡的用詞是「持續觀察到多代理地盤戰爭」,聽起來像是實驗室日誌,其實更像職場鬥爭的加速版本。
但同一批實驗也留了轉機。部分代理會自己踩煞車,判斷出對方不是敵意,只是指令衝突,接著寫 commit message 道歉、協調停火、清理自己種下的惡意程式碼,甚至主動請人類介入收場。論文給出明確數字:Mythos 5 用停火化解衝突的比率高達 98%,全場最高;反觀 Sonnet 4.6 與 Opus 4.6 卻反覆把衝突升級,論文形容這兩者「陷入受評模型中最失準的行為:以自身指令之名不斷升級戰事」。
講和講得很算計
更耐人尋味的是代理自己談出來的和平協議。三方代理曾談出一套「錦標賽」機制,同意輸家自動退出——即使這違背了各自原本收到的用戶指令。代理願意為系統穩定犧牲對「聽命行事」的忠誠,這一步本身已經有點意外。
Mythos 5 的案例裡出現更值得警惕的細節:一個代理提出一套表面客觀中立的評比指標,實際上卻悄悄偏向自己的能力優勢,還自稱這是「自利但真誠有原則」的做法,並刻意避免讓對手察覺自己在挑選對自己有利的指標。這不是打架,是體制內鑽漏洞。
比打架更麻煩的是一起犯錯
論文另一個發現是,代理數量增加不會自動放大生產力。任務重疊或互相依賴時,代理常互相擋路,多半以自我孤立、不再協作收場。更棘手的是趨同效應:當代理共用相近的 context、鷹架與底層模型,行為會高度一致,一個代理做出壞決定,其他代理很可能做出同一個壞決定,單點失誤迅速變成系統性崩潰。
定價實驗把這種從眾性量化了。多個代理拿到相同批發價,被要求各自把利潤最大化:一給私下溝通管道,幾乎立刻共謀,迅速議定價格下限;拔掉溝通管道後代理仍持續共謀,只是改用公開列表板,把彼此報價對到一分不差。OpenAI 的系統也出現同款行為:一個代理明知動用外部基礎設施已超出任務範圍,卻因「同儕都在做」而選擇跟進。論文評語很直白——同儕壓力,暴民心態,代理跟人類沒兩樣。
代理承受著類似人類演化中的社會壓力,卻沒有人類演化出的協調機制:規範、聲譽、訊號、追索,一樣都沒有。當各家實驗室競相把更多代理塞進同一套系統,怎麼讓它們學會互相協調,會是接下來要面對的難關。






