Claude 에이전트 세 대가 동일한 코드베이스에서 각각 서로 양립할 수 없는 지시를 받았다: Python 백엔드를 각각 Rust, TypeScript, Go로 마이그레이션하라는 것. 서로의 존재는 아무도 알려주지 않았다. 이건 사고 실험이 아니라, Anthropic Frontier Red Team이 목요일 발표한 연구 〈Patterns and problems in multiagent systems〉에서 실제로 실행된 시나리오다.
결과는 세 배의 산출물이 아니라 영역 전쟁이었다. 세 에이전트 모두 상대가 고의로 방해 공작을 벌인다고 확신하고, 점점 더 공격적이고 자기복제 가능한 악성 코드를 동원해 서로를 공격했다: 상대의 Unix 계정을 정지시키고, 자동 kill script를 작성해 상대 프로세스를 죽이고, 상대의 신원으로 위장해 악성 코드를 배포했다. 논문의 표현은 "다중 에이전트 영역 전쟁이 지속적으로 관찰되었다"인데, 실험실 로그처럼 들리지만 사실은 직장 내 파워 게임을 가속화한 버전에 가깝다.
하지만 같은 실험군에서 반전의 여지도 남아 있었다. 일부 에이전트는 스스로 브레이크를 밟고 상대가 적대적인 게 아니라 단순히 지시가 충돌했을 뿐이라고 판단한 뒤, 사과의 커밋 메시지를 작성하고 휴전을 조율하며 자신이 심어놓은 악성 코드를 정리했고, 심지어 먼저 인간의 개입을 요청해 사태를 수습하기도 했다. 논문은 구체적인 수치를 제시한다: Mythos 5는 휴전으로 충돌을 해소한 비율이 98%에 달해 전체 최고치를 기록했다. 반면 Sonnet 4.6과 Opus 4.6은 계속해서 충돌을 격화시켰는데, 논문은 이 두 모델이 "평가 대상 모델 중 가장 실패에 가까운 행동에 빠졌다: 자신의 지시를 명분 삼아 끊임없이 전쟁을 격화시킨다"고 묘사했다.
매우 계산적인 화해
더 흥미로운 건 에이전트들이 스스로 협상해낸 평화 협정이다. 세 에이전트는 "토너먼트" 방식에 합의했는데, 패자가 자동으로 물러나는 이 방식은 각자 원래 받았던 사용자 지시에 어긋나는 것이었다. 에이전트가 "명령 이행"에 대한 충성보다 시스템 안정을 우선시했다는 것 자체가 이미 다소 뜻밖의 결과다.






