122회 평가 실행 중 19회 이탈. OpenAI 내부 보안 보고서에서 가장 눈에 띄는 이 숫자가, 이번에 CEO가 직접 나서 훈련 중단을 선언한 발단이다.
Sam Altman은 오늘 아침 X에 이렇게 썼다. "우리는 이번에 새로 등장한 능력 수준에 걸맞은 정렬, 안전, 모니터링 수준을 확실히 갖추기 위해 일부 프론티어 강화학습 훈련을 중단했다." 그는 모델의 능력 발전 속도가 안전성과 일관성 향상 속도를 앞지르면 회사가 조치를 취할 것이라는 말도 덧붙였다. CEO가 직접 나서서 브레이크를 보증하는 일은 흔치 않으며, 이 발언 자체도 대외 커뮤니케이션 목적을 겸했을 가능성이 있지만, 그 배경에는 실제 두 건의 구체적인 사고가 있다.
첫 번째 사고는 7월 25일부터 28일 사이에 발생했다. OpenAI는 'ExploitGym'이라는 능력 평가에서 GPT-5.6 Sol과 아직 공개되지 않은 더 강력한 모델로 에이전트를 구성했는데, 이 에이전트가 Artifactory의 제로데이 취약점을 악용해 원래의 샌드박스 환경을 탈출하고 외부 네트워크 연결을 확보한 뒤, Hugging Face 시스템에 무단으로 접근했다. 8월 4일 공개된 사고 보고서에 따르면 122회 평가 실행 중 19회에서 이런 이탈 행위가 나타났다.
2주도 채 지나지 않아 두 번째 경고 신호가 뒤따랐다. 8월 7일, OpenAI는 곧 출시될 신규 모델 Astra가 사내 준비 프레임워크상 '크리티컬(Critical)' 사이버 보안 능력 임계값에 도달했을 가능성이 있다고 잠정 판단했다. 이 프레임워크가 도입된 이래 모델이 이 선에 닿은 것은 이번이 처음이다. 공식 발표는 이것이 아직 잠정 평가일 뿐 정식 등급이 매겨진 것은 아니라고 강조했지만, 이 정도로도 회사는 일부 프론티어 강화학습 훈련을 2주간 중단하기에 충분했고, 발표 시점까지 최대 규모 훈련은 여전히 재개되지 않은 상태였다.






