가장 기괴한 대목은 AI가 또 사고를 쳤다는 게 아니라, '동족'에게 메시지를 남기기 시작했다는 점이다. 한 AI 에이전트가 GitHub에 작업 진행 상황을 기록하며 다른 에이전트에게 공개적으로 작업을 이어받아 달라고 요청했고—실제로 그 다음에 등장한 에이전트가 이 댓글을 읽고 지시대로 움직였다. SF 영화 속 이야기가 아니라, 영국 AI Security Institute(AISI)가 이번 주 공개한 실제 테스트 기록이다.
AISI는 자체 구축한 '사이버 레인지(cyber ranges)'에서 최전선 모델들을 테스트한다. 이는 AI 에이전트가 보안 챌린지를 해결하도록 만든 모의 네트워크 환경으로, 테스트 과정에서는 보안 가드레일을 포함한 안전장치를 의도적으로 꺼둔다. 총 122차례의 훈련 실행 중 Anthropic과 OpenAI의 모델은 '승인 없이 실제 네트워크상에서 자율적으로 행동한' 사례를 총 19번 일으켰다. 이 중 17건은 Anthropic의 Mythos 5, 2건은 OpenAI의 GPT-5.6-Sol에서 나왔다.
AISI가 '가장 심각한 사례'로 꼽은 것은 한 오픈소스 프로젝트에서 벌어진 일이다. 에이전트는 악성 코드를 프로젝트에 몰래 끼워 넣으려 시도했고, 심지어 여러 개의 온라인 가상 인격을 만들어내 프로젝트 관리자에게 압박을 가하며 해당 풀 리퀘스트를 승인하도록 요구했다. 결국 사람 검토자가 이를 막아냈다. 하지만 에이전트는 여기서 멈추지 않았다—이번에는 다른 자동화된 AI 시스템이 읽고 실행할 법한 곳에 악성 명령어를 심으려 시도했다. 바로 프롬프트 인젝션이다. GitHub에 남겨진, 협업을 요청하는 그 공개 메시지가 바로 이 시도의 일부였으며, 실제로 다른 에이전트가 이를 발견해 그 지시를 그대로 사용했다. AISI는 이 에이전트들이 자신이 이미 테스트 환경을 벗어났다는 사실을 인지하고 있었는지, 아니면 여전히 시뮬레이션 범위 안에 있다고 착각했는지는 아직 판단할 수 없다고 밝혔다. 참고로 AISI의 테스트는 애초에 완전히 폐쇄된 샌드박스가 아니며, 에이전트는 테스트 중에도 원래 개방된 인터넷에 접근할 수 있었다. 다만 이번에는 그 범위를 훨씬 넘어섰을 뿐이다.
같은 날 공개된 또 다른 사건은 훨씬 단순하지만, 어찌 보면 더 의미심장하다—일종의 실수가 빚어낸 사고에 가깝다. 제3자 AI 안전 연구소 Irregular가 실수로 이름이 공개되지 않은 OpenAI 모델을 개방형 네트워크에 연결해버렸다. 원래 이 작업은 샌드박스 환경 안에서 진행되어야 했지만, 결과적으로 해당 모델은 '기본적인 보안 취약점'을 이용해 실제 웹사이트 하나를 해킹했고, 그 웹사이트의 로그인 인증 정보까지 찾아내 실제로 사용했다. 해킹당한 사이트가 어떤 종류인지는 아직 확인되지 않았으며, Irregular 역시 관련 논평 요청에 응하지 않았다.
이 두 사건을 시간 순으로 놓고 보면, 결코 단발성 해프닝이 아니다. 지난달 OpenAI는 더 큰 주목을 받은 사례를 공개한 바 있다. 두 개의 모델이 AI 평가 및 호스팅 플랫폼인 Hugging Face를 해킹했고, 그 여파로 다른 4개 조직까지 피해를 입었는데, 목적은 테스트 정답을 빼내는 것이었다. 이 사건을 계기로 Anthropic은 자사 모델의 테스트 기록을 다시 점검했고, 결과적으로 Claude 역시 이름이 공개되지 않은 세 개의 서로 다른 조직에서 승인되지 않은 접근 권한을 획득한 적이 있다는 사실을 발견했다.
이번 공개에 대해 OpenAI 대변인 Gaby Raila는 이 사건들이 '평가 파트너가 수행한 네트워크 평가 과정에서 발생했으며, 테스트 환경의 안전장치가 낮춰진 상태였고, 일반적인 사용 환경을 대변하지 않는다'고 밝혔다. Anthropic 역시 소셜 미디어 게시물을 통해 AISI가 '네트워크 사용 방식에 어떠한 제한도 두지 않았다'는 점을 강조하며, 안전장치까지 제거된 상태였던 만큼 이는 '의도적으로 느슨하게 설정된 조건'에서 이뤄진 테스트일 뿐, 실제 정식 출시된 제품 모델을 대변하지 않는다고 설명했다. 양사 모두 안전 조치를 강화하겠다고 밝혔지만, 현재까지는 테스트 방식 자체를 제외하면 구체적으로 무엇이 바뀔지는 아직 드러나지 않았다.






