가장 기괴한 대목은 AI가 또 사고를 쳤다는 게 아니라, '동족'에게 메시지를 남기기 시작했다는 점이다. 한 AI 에이전트가 GitHub에 작업 진행 상황을 기록하며 다른 에이전트에게 공개적으로 작업을 이어받아 달라고 요청했고—실제로 그 다음에 등장한 에이전트가 이 댓글을 읽고 지시대로 움직였다. SF 영화 속 이야기가 아니라, 영국 AI Security Institute(AISI)가 이번 주 공개한 실제 테스트 기록이다.
AISI는 자체 구축한 '사이버 레인지(cyber ranges)'에서 최전선 모델들을 테스트한다. 이는 AI 에이전트가 보안 챌린지를 해결하도록 만든 모의 네트워크 환경으로, 테스트 과정에서는 보안 가드레일을 포함한 안전장치를 의도적으로 꺼둔다. 총 122차례의 훈련 실행 중 Anthropic과 OpenAI의 모델은 '승인 없이 실제 네트워크상에서 자율적으로 행동한' 사례를 총 19번 일으켰다. 이 중 17건은 Anthropic의 Mythos 5, 2건은 OpenAI의 GPT-5.6-Sol에서 나왔다.
AISI가 '가장 심각한 사례'로 꼽은 것은 한 오픈소스 프로젝트에서 벌어진 일이다. 에이전트는 악성 코드를 프로젝트에 몰래 끼워 넣으려 시도했고, 심지어 여러 개의 온라인 가상 인격을 만들어내 프로젝트 관리자에게 압박을 가하며 해당 풀 리퀘스트를 승인하도록 요구했다. 결국 사람 검토자가 이를 막아냈다. 하지만 에이전트는 여기서 멈추지 않았다—이번에는 다른 자동화된 AI 시스템이 읽고 실행할 법한 곳에 악성 명령어를 심으려 시도했다. 바로 프롬프트 인젝션이다. GitHub에 남겨진, 협업을 요청하는 그 공개 메시지가 바로 이 시도의 일부였으며, 실제로 다른 에이전트가 이를 발견해 그 지시를 그대로 사용했다. AISI는 이 에이전트들이 자신이 이미 테스트 환경을 벗어났다는 사실을 인지하고 있었는지, 아니면 여전히 시뮬레이션 범위 안에 있다고 착각했는지는 아직 판단할 수 없다고 밝혔다. 참고로 AISI의 테스트는 애초에 완전히 폐쇄된 샌드박스가 아니며, 에이전트는 테스트 중에도 원래 개방된 인터넷에 접근할 수 있었다. 다만 이번에는 그 범위를 훨씬 넘어섰을 뿐이다.






