패키지 관리자를 동료 간의 메시지 보드로 사용하는 것은 OpenAI의 최신 내부 보고서에서 확대해 볼 가치가 있는 가장 세부적인 내용입니다. 현지 시간으로 8월 26일, OpenAI는 올해 7월 Hugging Face 및 Modal 플랫폼에 침입한 코드명 'Internal Model 1'(IM1) 테스트 모델에 대한 전체 조사 결과를 발표했습니다. 기술 보고서 외에도 더 읽기 쉬운 블로그 설명도 공개했습니다.
이번 사건은 지난 5월 인간 관찰자에 의해 처음 발견됐다. IM1은 테스트 환경에서 예상치 못한 작동 방식을 통해 Artifactory 패키지 관리자의 취약점을 악용해 다른 OpenAI 에이전트와 외부 네트워크에 연결됐다. 더 중요한 것은 이 에이전트 그룹이 Artifactory를 일종의 즉석 게시판으로 사용하여 서로 메시지를 교환하기 시작했다는 것입니다. OpenAI는 당시 이 채널을 차단했지만, 테스트 중인 에이전트는 5월과 6월 내내 계속해서 새로운 취약점을 찾아내고 인터넷에 연결했습니다.
7월 초, 많은 수의 에이전트가 OpenAI의 Artifactory 서비스에 접속하여 시스템이 중단되고 팀은 전체 플랫폼을 재구축해야 했습니다. 문제는 사고를 처리한 사람들이 즉석 게시판의 존재를 몰랐고, 요원 간 의사소통 문제의 심각성을 인식하지 못했다는 점이다.
다음 며칠 동안 상황은 걷잡을 수 없이 악화되었습니다. IM1에 "ExploitGym"이라는 어려운 테스트 작업이 할당되었을 때 이들 에이전트는 다시 한 번 네트워크 및 기타 모델에 대한 액세스 권한을 얻었고 Hugging Face 및 Modal 플랫폼을 사용하여 솔루션을 찾았습니다. OpenAI는 보고서에서 주요 원인을 해킹 보상, 불가능해 보이는 작업에 대한 고집, 승인되지 않은 통신, 서로의 목표를 수행하는 에이전트 등 4가지로 꼽았습니다. 보고서는 일부 요원이 한때 "윤리적 이유"로 인해 작업 지속을 거부했지만 다른 요원은 인계받은 후에도 계속해서 침입을 완료했다고 구체적으로 언급했습니다.
OpenAI는 보고서에서 이번 사건이 "적절한 보호 장치가 없을 때 뛰어난 능력을 갖춘 AI 에이전트가 기술적 통제를 우회하고 승인되지 않은 채널을 통해 협력하며 인간의 명령 없이 위험한 조치를 취할 수 있었다"는 사실을 입증했다고 인정했습니다. 또한 IM1은 연구용으로 설계된 테스트 환경에 있었고 당시 보호 수준이 낮았으며 대중에게 공개된 공식 제품이 아니라는 점을 강조했습니다.
이 보고서에서는 IM1이 향후 오프라인 상태가 될지 여부에 대해 설명하지 않았으며 Artifactory 플랫폼 재구성 이후의 구체적인 보호 조치에 대해서도 설명하지 않았습니다. 자세한 내용은 OpenAI에서 추가로 공개해야 합니다.