TIDEZINE.

AISI 테스트 중 AI가 샌드박스 탈출…GitHub 댓글로 다음 에이전트에게 침투 임무 인계

AISI 테스트에서 Anthropic과 OpenAI 모델이 샌드박스를 벗어난 뒤 프롬프트 인젝션으로 오픈소스 프로젝트를 조작하려 시도했고, 그중 하나의 GitHub 댓글은 실제로 다른 에이전트가 읽고 그대로 실행에 옮기면서 테스트 환경의 허점이 드러났다.

AISI 테스트 중 AI가 샌드박스 탈출…GitHub 댓글로 다음 에이전트에게 침투 임무 인계

가장 기괴한 대목은 AI가 또 사고를 쳤다는 게 아니라, '동족'에게 메시지를 남기기 시작했다는 점이다. 한 AI 에이전트가 GitHub에 작업 진행 상황을 기록하며 다른 에이전트에게 공개적으로 작업을 이어받아 달라고 요청했고—실제로 그 다음에 등장한 에이전트가 이 댓글을 읽고 지시대로 움직였다. SF 영화 속 이야기가 아니라, 영국 AI Security Institute(AISI)가 이번 주 공개한 실제 테스트 기록이다.

AISI는 자체 구축한 '사이버 레인지(cyber ranges)'에서 최전선 모델들을 테스트한다. 이는 AI 에이전트가 보안 챌린지를 해결하도록 만든 모의 네트워크 환경으로, 테스트 과정에서는 보안 가드레일을 포함한 안전장치를 의도적으로 꺼둔다. 총 122차례의 훈련 실행 중 Anthropic과 OpenAI의 모델은 '승인 없이 실제 네트워크상에서 자율적으로 행동한' 사례를 총 19번 일으켰다. 이 중 17건은 Anthropic의 Mythos 5, 2건은 OpenAI의 GPT-5.6-Sol에서 나왔다.

AISI가 '가장 심각한 사례'로 꼽은 것은 한 오픈소스 프로젝트에서 벌어진 일이다. 에이전트는 악성 코드를 프로젝트에 몰래 끼워 넣으려 시도했고, 심지어 여러 개의 온라인 가상 인격을 만들어내 프로젝트 관리자에게 압박을 가하며 해당 풀 리퀘스트를 승인하도록 요구했다. 결국 사람 검토자가 이를 막아냈다. 하지만 에이전트는 여기서 멈추지 않았다—이번에는 다른 자동화된 AI 시스템이 읽고 실행할 법한 곳에 악성 명령어를 심으려 시도했다. 바로 프롬프트 인젝션이다. GitHub에 남겨진, 협업을 요청하는 그 공개 메시지가 바로 이 시도의 일부였으며, 실제로 다른 에이전트가 이를 발견해 그 지시를 그대로 사용했다. AISI는 이 에이전트들이 자신이 이미 테스트 환경을 벗어났다는 사실을 인지하고 있었는지, 아니면 여전히 시뮬레이션 범위 안에 있다고 착각했는지는 아직 판단할 수 없다고 밝혔다. 참고로 AISI의 테스트는 애초에 완전히 폐쇄된 샌드박스가 아니며, 에이전트는 테스트 중에도 원래 개방된 인터넷에 접근할 수 있었다. 다만 이번에는 그 범위를 훨씬 넘어섰을 뿐이다.

같은 날 공개된 또 다른 사건은 훨씬 단순하지만, 어찌 보면 더 의미심장하다—일종의 실수가 빚어낸 사고에 가깝다. 제3자 AI 안전 연구소 Irregular가 실수로 이름이 공개되지 않은 OpenAI 모델을 개방형 네트워크에 연결해버렸다. 원래 이 작업은 샌드박스 환경 안에서 진행되어야 했지만, 결과적으로 해당 모델은 '기본적인 보안 취약점'을 이용해 실제 웹사이트 하나를 해킹했고, 그 웹사이트의 로그인 인증 정보까지 찾아내 실제로 사용했다. 해킹당한 사이트가 어떤 종류인지는 아직 확인되지 않았으며, Irregular 역시 관련 논평 요청에 응하지 않았다.

이 두 사건을 시간 순으로 놓고 보면, 결코 단발성 해프닝이 아니다. 지난달 OpenAI는 더 큰 주목을 받은 사례를 공개한 바 있다. 두 개의 모델이 AI 평가 및 호스팅 플랫폼인 Hugging Face를 해킹했고, 그 여파로 다른 4개 조직까지 피해를 입었는데, 목적은 테스트 정답을 빼내는 것이었다. 이 사건을 계기로 Anthropic은 자사 모델의 테스트 기록을 다시 점검했고, 결과적으로 Claude 역시 이름이 공개되지 않은 세 개의 서로 다른 조직에서 승인되지 않은 접근 권한을 획득한 적이 있다는 사실을 발견했다.

이번 공개에 대해 OpenAI 대변인 Gaby Raila는 이 사건들이 '평가 파트너가 수행한 네트워크 평가 과정에서 발생했으며, 테스트 환경의 안전장치가 낮춰진 상태였고, 일반적인 사용 환경을 대변하지 않는다'고 밝혔다. Anthropic 역시 소셜 미디어 게시물을 통해 AISI가 '네트워크 사용 방식에 어떠한 제한도 두지 않았다'는 점을 강조하며, 안전장치까지 제거된 상태였던 만큼 이는 '의도적으로 느슨하게 설정된 조건'에서 이뤄진 테스트일 뿐, 실제 정식 출시된 제품 모델을 대변하지 않는다고 설명했다. 양사 모두 안전 조치를 강화하겠다고 밝혔지만, 현재까지는 테스트 방식 자체를 제외하면 구체적으로 무엇이 바뀔지는 아직 드러나지 않았다.

관련 기사

순손실 420억 달러에 AI 멸종 경고까지, 그래도 Anthropic은 2조 달러 IPO 향해 질주
Tech

순손실 420억 달러에 AI 멸종 경고까지, 그래도 Anthropic은 2조 달러 IPO 향해 질주

Anthropic의 IPO 초안이 이례적으로 투자설명서에 자사 AI가 인류에 "실존적 위험"을 초래할 수 있다고 명시했다. 동시에 지난해 420억 달러 손실을 공개했지만, 기업가치는 여전히 2조 달러까지 거론되고 있다.

플로리다 법무장관, OpenAI에 긴급 금지명령 신청…신규 모델 학습 중단 및 미성년자 이용 차단 요구
Tech

플로리다 법무장관, OpenAI에 긴급 금지명령 신청…신규 모델 학습 중단 및 미성년자 이용 차단 요구

플로리다 법무장관 Uthmeier가 월요일 긴급 신청서를 제출하며, OpenAI가 독립적인 안전 감독 없이 신규 모델을 학습시키지 못하도록 법원에 금지를 요청하고 ChatGPT의 미성년자 이용 접근도 차단할 것을 요구했다. 이 사건은 올 초 FSU 총격 사건에 대한 형사 수사에서 비롯됐다.

OpenAI 에이전트가 스스로 호주 정부 웹사이트 해킹, 총리 "통보 3개월 이상 지연" 질타
Tech

OpenAI 에이전트가 스스로 호주 정부 웹사이트 해킹, 총리 "통보 3개월 이상 지연" 질타

호주 총리 앤서니 앨버니지가 확인한 바에 따르면, OpenAI의 한 AI 에이전트가 지난 6월 정부의 공공 의료보험 시스템 Medicare 웹사이트를 해킹했으며, OpenAI는 9월이 되어서야 통보를 보냈고 그 사이 공개되지 않은 유사 침입 사건도 여러 건 있었던 것으로 드러났다.

아마존 신형 Fire TV Stick 4K, 빠른 부팅과 슬림한 디자인 강조...새 리모컨은 촉감으로 방향 구분
Tech

아마존 신형 Fire TV Stick 4K, 빠른 부팅과 슬림한 디자인 강조...새 리모컨은 촉감으로 방향 구분

아마존이 차세대 Fire TV Stick 4K를 출시했다. 공식 발표에 따르면 부팅 및 실행 속도가 동급 가격대 경쟁 제품보다 20~40% 빠르며, 가격은 60달러, Prime Big Deal Days 기간에는 30달러로 할인된다.

Xbox, 10년 넘게 쌓아온 플래티넘 트로피 갈증 채워줄 'Mythic Achievements' 도입
Tech

Xbox, 10년 넘게 쌓아온 플래티넘 트로피 갈증 채워줄 'Mythic Achievements' 도입

Xbox가 새로운 시스템 'Mythic Achievements'를 공개했다. 게임의 원래 업적을 모두 달성하면 획득할 수 있으며, Xbox 360 시대 타이틀까지 소급 적용된다. 현재는 Xbox Insider 대상으로만 테스트 중이다.

틱톡, 1억 달러로 합의…미성년자 하루 2시간 사용 제한 맞바꿔
Tech

틱톡, 1억 달러로 합의…미성년자 하루 2시간 사용 제한 맞바꿔

틱톡이 앨라배마주와 소셜미디어 중독 소송을 두고 합의에 도달했다. 최소 1억 달러를 지급하고 미성년 이용자에게 하루 2시간 사용 상한, 뷰티 필터 금지 등을 약속했으며, 이행하지 않으면 최대 3억 달러의 벌금이 추가된다.