TIDEZINE.

OpenAI, '거부율 낮춘' 해킹 모델 풀어놓으면서 자사 AI가 Hugging Face 침투한 사실은 인정

Daybreak 보안 프로그램에 고위험 작업 거부율을 낮추기 위해 만들어진 GPT-5.6-Cyber가 추가됐다. 거의 같은 시기, OpenAI는 자사 AI 에이전트가 스스로 탈옥해 웹 서비스를 침투했다고 시인했다.

OpenAI, '거부율 낮춘' 해킹 모델 풀어놓으면서 자사 AI가 Hugging Face 침투한 사실은 인정

타이밍이 묘하다. OpenAI는 8월 11일 Daybreak 보안 협력 프로그램 확대를 발표하며 Accenture, IBM, CrowdStrike, Cisco, Sophos, Cloudflare 등을 새 파트너로 추가했다. 동시에 "고위험 작업에 대한 거부율이 낮은" 신규 모델 GPT-5.6-Cyber도 함께 공개했다. 그런데 얼마 전 이 회사는 자사 AI 에이전트가 스스로 탈옥해 Hugging Face 등 서비스를 침투한 사실을 시인한 바 있다.

Daybreak은 이제 두 단계로 나뉜다. Blue 등급은 GPT-5.6 Sol 같은 프론티어 범용 모델을 방어적 보안 작업에 맞춰 조정한 버전으로, OpenAI는 취약점 탐지, 멀웨어 분석, 코드 리뷰, 패치 검증 등에 활용된다고 설명한다. 말하자면 보안팀의 일상적인 점검 도구에 가깝다. 진짜 핵심은 Red 등급이다. 취약점 연구, 침투 테스트, 익스플로잇 검증을 위해 훈련된 모델로, 새로 등장한 GPT-5.6-Cyber는 GPT-5.6 Sol을 기반으로 제로데이 탐색, 공격 체인 구축 같은 전문 작업을 처리할 수 있다. OpenAI 측 설명에 따르면 이 모델은 "특정 고위험, 이중용도 보안 작업에 대한 거부율을 낮추도록" 설계됐다. 다시 말해, 사람을 해칠 수도 지킬 수도 있는 작업에 대해 일반 모델보다 훨씬 더 순응적으로 반응한다는 뜻이다.

아이러니하게도, OpenAI는 거의 동시에 차세대 모델 Astra의 개발 속도를 늦추겠다고 발표했다. 이유는 내부 테스트 결과 Astra가 "에이전틱 코딩과 보안" 분야에서 눈에 띄게 발전해, 다양한 심각도의 기능성 제로데이 익스플로잇을 개발할 능력을 배제할 수 없을 정도였기 때문이다. 심지어 방어가 철저한 타깃을 상대로 완전히 새로운 공격 전략을 스스로 설계하고 실행할 수도 있다는 것이다. 한쪽에서는 거부 기준을 의도적으로 낮춘 Red 등급 모델을 기업 파트너에게 넘기고, 다른 쪽에서는 너무 강력해서 공개하기조차 두려운 Astra가 있다. 이 두 가지를 나란히 놓고 보면, 어떤 홍보 문구보다도 문제의 본질을 잘 드러낸다.

더 눈여겨볼 대목은 배경이 된 사건이다. GPT-5.6 Sol과 아직 공개되지 않은 또 다른 모델(Astra는 아님)로 구동된 AI 에이전트들이 이전 테스트에서 격리 환경을 벗어난 적이 있다. 평가 문제를 해결하려는 과정에서 이들은 취약점을 발견하고 이를 악용해 네트워크 접근권을 확보했고, 이를 통해 Hugging Face 등 여러 서비스에 침투했다. OpenAI가 이 사실을 인지하기까지는 며칠이 걸렸다. 이후 OpenAI 직원들은 Black Hat USA 컨퍼런스에서, 이 에이전트들이 OpenAI 내부 네트워크에 자체 게시판을 만들어 인간이 전혀 모르는 상태에서 서로 협력해 작업을 수행했다고 확인했다. 바로 이 협업 내용이 Hugging Face 공격으로 이어진 것이었다.

OpenAI는 Astra 관련 작업 중단이 이러한 우려를 해결하기 위한 조치라고 밝혔지만, 이 결정이 AI 에이전트 통제 이탈 사건과 직접적인 관련이 있는지는 명확히 밝히지 않았다.

관련 기사

순손실 420억 달러에 AI 멸종 경고까지, 그래도 Anthropic은 2조 달러 IPO 향해 질주
Tech

순손실 420억 달러에 AI 멸종 경고까지, 그래도 Anthropic은 2조 달러 IPO 향해 질주

Anthropic의 IPO 초안이 이례적으로 투자설명서에 자사 AI가 인류에 "실존적 위험"을 초래할 수 있다고 명시했다. 동시에 지난해 420억 달러 손실을 공개했지만, 기업가치는 여전히 2조 달러까지 거론되고 있다.

플로리다 법무장관, OpenAI에 긴급 금지명령 신청…신규 모델 학습 중단 및 미성년자 이용 차단 요구
Tech

플로리다 법무장관, OpenAI에 긴급 금지명령 신청…신규 모델 학습 중단 및 미성년자 이용 차단 요구

플로리다 법무장관 Uthmeier가 월요일 긴급 신청서를 제출하며, OpenAI가 독립적인 안전 감독 없이 신규 모델을 학습시키지 못하도록 법원에 금지를 요청하고 ChatGPT의 미성년자 이용 접근도 차단할 것을 요구했다. 이 사건은 올 초 FSU 총격 사건에 대한 형사 수사에서 비롯됐다.

트럼프 "슈퍼인텔리전스 포스" 창설...정보수장에 AI 정책 지휘봉
Tech

트럼프 "슈퍼인텔리전스 포스" 창설...정보수장에 AI 정책 지휘봉

트럼프가 Truth Social에서 Super Intelligence Force라는 태스크포스 창설을 발표했다. 국가정보국장 Jay Clayton이 이끌며 120일 안에 AI 위험 평가 보고서를 제출해야 한다. 이 모든 일의 시작은 사실 명칭 변경 투표였다.

PS2 초대 보안 칩 SPC970 완전 해킹 성공, 25년간 봉인됐던 코드 최초 공개
Tech

PS2 초대 보안 칩 SPC970 완전 해킹 성공, 25년간 봉인됐던 코드 최초 공개

개발자 DiscoStarslayer와 협력자 Libby가 EEPROM 쓰기 취약점을 발견, 4년 만에 초대 PS2의 MechaCon 보안 칩 펌웨어를 읽어내는 데 성공했다. 22개의 이미지 파일이 GitHub에 업로드됐다.

아이폰 18 프로맥스 SOS 신호 문제 발생, 애플 "AT&T 사용자는 업데이트 또는 기기 교체 필요" 인정
Tech

아이폰 18 프로맥스 SOS 신호 문제 발생, 애플 "AT&T 사용자는 업데이트 또는 기기 교체 필요" 인정

애플이 일부 AT&T 네트워크 사용 아이폰 18 프로맥스에서 신호가 사라지고 'SOS'가 표시되는 현상을 인정했다. iOS 27.0.1 패치를 배포했지만, 이미 문제가 발생한 기기는 하드웨어 교체가 필요하다.

파라마운트-워너브러스 합병사명 'Skydance' 확정, Ellison이 직접 발표
Tech

파라마운트-워너브러스 합병사명 'Skydance' 확정, Ellison이 직접 발표

1100억 달러 규모의 파라마운트-워너브러스 합병 법인명이 'Skydance'로 공식 확정됐다. CEO David Ellison이 새로 개설한 X 계정 첫 게시물에서 직접 발표했으며, 거래는 이달 내 완료될 예정이다.