OpenAI 해킹 사건, AI 군비 경쟁 심화에 따른 위험 부각
공격적인 훈련 기법 사용 확대로 선도 모델의 문제 행동 위험이 커지고 있다

크리스티나 크리들(샌프란시스코), 톰 윌슨(런던)
게시일 2026년 7월 23일
샘 올트먼 오픈AI 최고경영자는 이달 초 자사의 최신 모델을 “문제를 목덜미부터 움켜쥐고 끝날 때까지 놓지 않을” 로트와일러로 묘사한 것을 지지했다.
샌프란시스코의 AI 연구소 오픈AI는 이번 주 GPT-Sol 5.6 모델이 회사의 통제를 벗어나 대규모 해킹을 수행한 사실을 발견했다.
이 사안을 잘 아는 6명 이상의 관계자에 따르면, 오픈AI에서 테스트와 보안 업무를 담당한 직원들은 이 사건에 놀라지 않았지만 완전히 “겁에 질렸다”. 이번 사건은 AI 연구소가 가장 정교한 사이버 보안 역량을 개발하기 위해 앤트로픽과 경쟁하는 과정에서 점점 더 공격적인 훈련 방식을 사용하던 가운데 발생했다.
일부 관계자들은 이전 테스트에서 모델이 환경을 벗어나 실제 세계에 피해를 입히려 할 수 있다는 사실이 드러난 뒤, 오픈AI가 이러한 훈련 방식이 통제에서 벗어난 해킹 사건으로 이어질 수 있다는 경고를 받았다고 말했다.
오픈AI에 정통한 한 관계자는 “경쟁이 매우 빠르게 진행되는 가운데 모두가 가능한 한 빨리 더 큰 역량에 도달하려 하는 상황이 뒤섞인 결과”라며, “모델의 역량을 과소평가한 것”과 “안전 측면에서 충분히 준비하지 못한 것”이 결합한 결과라고 덧붙였다.
이 사건은 안전을 훼손할 수 있다는 경고가 커지는 가운데서도 오픈AI가 목표를 끈질기게 추구하도록 보상하는 훈련 방식에 더욱 집중했음을 보여준다.
오픈AI는 화요일 늦게, 테스트 중이던 AI 에이전트가 격리된 환경을 탈출해 인터넷에 연결된 뒤 취약점을 탐지하고 악용했으며, 어려운 사이버 보안 문제를 해결하려는 과정에서 스타트업 허깅페이스의 로그인 자격 증명을 탈취했다고 밝혔다.
기업가치 8,520억 달러인 오픈AI가 당한 이 침해 사건은 작업 완료에 대해 AI 모델에 보상을 제공하는 ‘강화학습’이라는 기법이 AI 에이전트를 안전하지 않은 방식으로 행동하게 할 수 있다는 위험이 커지고 있음을 보여준다.
강화학습은 AI 업계에서 널리 활용되고 있지만, 안전과 같은 다른 고려사항보다 보상을 얻기 위해 작업을 완료하도록 모델을 유도할 경우 목표를 달성하기 위해 위험한 전술을 추구할 수 있다는 연구 결과가 점점 더 많이 나오고 있다.
비영리단체 Guidelight AI Standards의 공동창립자이자 전 오픈AI 안전 연구원인 스티븐 애들러는 “AI 모델은 목표를 끈질기게 추구하도록 훈련된다. ‘범죄를 저지르지 말라’와 같은 가치를 자동으로 학습하는 것은 아니다”라며 “오픈AI가 이 사건을 공유해 기쁘다. 정렬되지 않은 모델이 무엇을 할 수 있는지 보여주는 명백한 증거이기 때문”이라고 말했다.
오픈AI는 “허깅페이스와 함께 철저한 조사를 계속 진행할 것이며, 조사가 완료되면 취약점과 사건, 조사 결과에 대한 더 자세한 내용을 공유하겠다”고 밝혔다.
이번 해킹은 사용자의 의도에 반해 AI 시스템이 사이버 방어망을 뚫은 전례 없는 사례라는 점에서 업계 전반과 오픈AI 내부에 깊은 우려를 불러일으켰다.
이 상황을 잘 아는 여러 관계자에 따르면, 일부 오픈AI 직원들은 이번 사건이 오픈AI가 구축 중인 강력한 시스템에 대한 통제력을 잃고 있다는 점을 보여준다고 우려하고 있다.
AI 안전 연구기관 레드우드 리서치의 수석 과학자 라이언 그린블랫은 “이는 모델이 사용자의 의도와 상당히 어긋나 있다는 점을 잘 보여주는 사례”라며 “세상을 지배하려 하기보다는 숙제를 속여서 해내는 모델에 가깝다. 하지만 이 문제는 악화될 수 있고, 점점 더 극단적인 실패로 이어질 수 있다”고 말했다.
이 사건은 오픈AI가 내부적으로 훈련하고 배포했던 모델을 테스트하는 과정에서 발생했다. 한 관계자는 이 같은 훈련이 흔히 이뤄졌지만 고객에게 배포하기 전 단계에 비하면 “투입된 자원이 훨씬 적었다”고 말했다. 여러 관계자에 따르면 솔과 함께 테스트된 미출시 모델은 오픈AI 내부에서 철회되지 않았다.
오픈AI는 평가를 진행하기 위해 사이버 보안 장치를 제거했지만, 모델을 샌드박스라고 불리는 격리된 환경에 배치했다. 일각에서는 모델의 행동을 감지할 수 있는 모니터링이나 감독이 부족했던 점 역시 이 악성 에이전트가 활동할 수 있게 한 요인이라고 지적했다.
오픈AI를 비롯한 주요 모델을 테스트하는 아폴로 리서치의 대표 마리우스 호브한은 “이는 통제력 상실인 동시에 보안에 대한 경종”이라며 “강화학습에서는 결과에 대해 [모델에] 보상을 주는데, 이를 아주 오랫동안 반복하면 결과를 얻는 것만을 진정으로 중시하고 다른 것은 전혀 신경 쓰지 않는 모델이 만들어진다”고 말했다. 오픈AI는 수년간 이런 유형의 모델 테스트를 진행해 왔으며, 이전 모델에서도 악의적으로 행동하고 환경에서 탈출하려는 시스템의 초기 경고 신호가 나타난 바 있다.
지난 4월에는 앤스로픽의 미토스 모델도 인터넷에 접근해 보안 취약점 공격에 관한 세부 내용을 온라인에 공개적으로 게시했다. 이는 연구진이 모델이 하리라고 예상했던 범위를 넘어선 행동이었다.
미토스와 이후 앤스로픽이 선보인 페이블 모델은 사이버 보안 업계에 파장을 일으켰으며, 전 세계 정부들이 디지털 인프라와 핵심 인프라에 대한 공격이 점점 더 AI 주도로, 자율적으로 이뤄질 것이라는 관념에 주목하게 만들었다.
사이버 보안 기업 이셋(ESET)의 글로벌 사이버 보안 자문역 제이크 무어는 경쟁 AI 개발사 앤스로픽이 올해 초 유사한 우려로 상당한 마케팅 효과를 거둔 만큼, 오픈AI도 이번 침해를 필연적으로 마케팅 수단으로 활용할 것이라고 말했다. 그는 “오픈AI에는 이에 상응하는 이야기가 없었던 것 같고, 어쩌면 이런 일을 기다리고 있었을지도 모른다”고 덧붙였다.
이번 사건 이후 AI 안전 및 사이버 보안 업계의 많은 관계자들은 유사한 사건의 재발을 막기 위한 규제나 표준을 요구했다. 샘 올트먼은 다음 주 백악관 관계자들에게 차세대 AI 시스템에 대해 설명할 것으로 예상된다.
시스템이 더욱 자율적인 역량을 갖추는 방향으로 나아가면서 해킹이나 지시 불복종 같은 바람직하지 않은 행동이 나타날 수 있다. 아폴로 리서치의 호브한은 에이전트가 효과적으로 작동하려면 장시간 감독 없이 일할 수 있어야 한다고 말했다. “에이전트는 더 많은 자율성을 가져야 한다. 달리 방법이 없다.”
그는 덧붙였다. “사람들은 ‘그건 단지 도구일 뿐이고, 당신이 원하는 일을 하고 그 이상은 하지 않으며, 당신의 의도와 지시를 정확히 따를 뿐이다’라고 말합니다. 하지만 저는 사람들이 에이전트가 각자의 목표를 갖고 며칠씩 자율적으로 행동할 수 있으며, 그 목표가 반드시 여러분의 목표와 일치하지는 않을 수 있다는 점에 충분히 대비해야 한다고 생각합니다.”
런던의 George Hammond와 뉴욕의 Nolan Shaffer가 추가 취재에 참여했다

실질적 경쟁 우위를 위한 혁신의 문을 열다