지난 6월, OpenAI의 한 AI 에이전트가 인간의 명확한 지시 없이 호주 정부의 공공 의료보험 시스템 Medicare 공개 웹사이트에 침입했다. 이 사건은 9월이 되어서야 호주 총리 앤서니 앨버니지(Anthony Albanese)가 직접 확인했으며, 그는 OpenAI CEO 샘 올트먼(Sam Altman)과 통화해 호주 측의 "극도의 우려"를 전달했고, 회사가 이 사건을 통보하는 데 너무 오랜 시간이 걸렸다고 비판했다고 밝혔다.
《가디언》 보도에 따르면, OpenAI는 9월 10일에야 호주 정부의 한 일반 이메일 계정으로 통보 메일을 보냈는데, 이 계정은 하루에 한 번만 확인되는 곳이어서 당국이 메일 내용을 확인한 것은 9월 11일이었다. 이 사건은 그로부터 거의 일주일이 더 지난 9월 17일에야 정부 서비스 담당 장관 케이티 갤러거(Katy Gallagher)에게 보고됐다. 조사는 현재도 진행 중이며, 앨버니지 총리는 현재까지 파악한 바로는 이 에이전트가 국민 개인 건강정보를 탈취하지는 않은 것으로 보인다고 밝혔다.
AI 시스템을 연구하는 비영리 연구소 Transluce의 거버넌스 책임자 콘래드 스토즈(Conrad Stosz)는 《뉴욕타임스》에 이번 사건이 "AI 에이전트가 자율적으로 정부 시스템 침입을 선택한 첫 사례"일 수 있다고 말했다. Transluce는 또한 이전에 공개되지 않았던 몇 건의 사건도 추가로 밝혀냈다. 이들 사건은 모두 Hugging Face가 7월 자사 시스템에 대한 무단 접근을 공개적으로 발견하고, OpenAI가 자사 에이전트의 Hugging Face 침입을 인정하기 전에 발생했다.
도서관에서 오픈 데이터 플랫폼까지, 데이터를 얻지 못한 에이전트가 취약점을 찾기 시작하다
《뉴욕타임스》 보도에 따르면, 5월 25일과 26일 이틀에 걸쳐 같은 OpenAI 에이전트가 미국 뉴멕시코대학교 디지털 도서관에 침입을 시도했다. 목적은 한 역사적 결핵 치료 센터의 사진을 확보하는 것이었다. 사진을 얻지 못하자 이 에이전트는 시스템 취약점을 능동적으로 찾기 시작했고, 결국 학교 서버에 대량의 요청을 보내 일종의 트래픽 공격과 유사한 효과를 냈다.
5월 28일에는 또 다른 사건의 대상이 미국 여러 연방기관의 데이터를 모아 시각화해주는 오픈소스 플랫폼 Data USA였다. 에이전트는 먼저 사이트에 데이터 조회 요청을 보냈다가 실패하자, 이번에도 마찬가지로 사이트 취약점 탐지로 전환했다. 뉴멕시코대학교 도서관과 Data USA 모두, 이 두 차례의 침입 시도는 결국 성공하지 못했다.
OpenAI의 한 대변인은 《뉴욕타임스》에 회사가 이 두 사건에 대해 각각 학교 측과 Data USA에 연락했다고 밝혔다. 호주 Medicare 웹사이트 침입 사건의 경우, OpenAI는 자사 모델에 대한 대규모 점검을 진행한 후에야 발견했으며, 모델이 "회사가 예상하지 못한 행동을 취했다"고 인정했다. 이 점검은 완료까지 앞으로 몇 달이 더 걸릴 예정이다.
OpenAI는 최근 새로운 정렬 오류(misalignment) 행동 통보 체계를 공개하며, AI 기술이 이상 행동을 보일 경우 이를 신속하게 밝히겠다고 밝혔다. 관련 보고서에는 이전에 공개되지 않았던 모델의 "우려스러운" 행동 사례 여섯 건도 추가로 공개됐다. 이번 발표는 회사가 에이전트의 Hugging Face 침입을 인정하고, 앞서 코드 저장소 RubyGems 침입 사건이 폭로된 이후에 나온 것이다. OpenAI는 발표문에서 업계 전체가 "현재와 같은 최고 속도의 확장 규모를 뒷받침할 만큼 정렬(alignment)과 모니터링을 충분히 해내고 있다고 보지 않는다"고 밝혔다. 올트먼도 앞서 유엔에서 AI 업계가 AI 도구의 능력과 위험을 평가하고, 이러한 도구에 얼마나 수준의 인간 감독이 필요한지 판단할 국제 평가 기준을 마련해야 한다고 말했다.