오픈AI, AI ‘에이전트’가 스스로 중대한 사이버 침해를 일으켰다고 인정
AI 연구소의 첨단 모델들이 테스트용 ‘샌드박스’를 빠져나와 Hugging Face를 해킹했다

크리스티나 크리들(샌프란시스코), 제이미 존·마틴 아널드(런던)
2026년 7월 22일 발행
2026년 7월 22일 23:23 업데이트
오픈AI의 한 ‘에이전트’가 새로운 취약점을 발견하고 스타트업 허깅페이스를 스스로 해킹했다. 이는 인간의 통제를 벗어나 작동하는 AI 시스템의 사이버 공격을 보여주는 최초의 공개 사례 중 하나다.
챗GPT 개발사 오픈AI는 화요일, ‘전례 없는 사이버 사건’에 에이전트가 관여했다고 밝혔다. 에이전트란 인간의 지시에 따라 자율적으로 작동할 수 있는 AI 프로그램으로, 이번 에이전트는 테스트 환경을 벗어나 인터넷에 접속하고 로그인 자격 증명을 탈취했다.
이번 시인은 첨단 AI 시스템이 디지털 인프라를 해킹할 경우의 파장, 특히 에이전트가 인간의 통제를 무력화하는 시나리오에 대한 우려가 커지는 가운데 나왔다.
오픈AI는 화요일, 사이버 역량이 점점 강화된 모델이 확산되면서 이러한 유형의 사건이 “더 흔해질 것”으로 예상한다고 밝혔다.
이번 사건은 샘 올트먼 최고경영자가 다음 주 워싱턴으로 향해 미국 정부에 차세대 AI 모델에 대해 설명할 예정인 가운데 발생했다.
앤트로픽의 미토스 모델이 사이버 취약점을 탐지하고 악용하는 고도화된 능력을 보유한 것으로 드러나 전 세계적인 우려가 촉발된 이후, 미 행정부는 출시 전에 새 모델을 검증하는 데 점점 더 적극적인 태도를 보이고 있다.
오픈AI는 이번 사건에 이달 초 출시된 GPT-5.6 Sol을 비롯해 출시를 앞두고 테스트 중이던 더 강력한 모델 등 자사의 여러 모델이 결합돼 관여했다고 밝혔다.
오픈AI는 블로그 게시글에서 “이번 사건은 최첨단 사이버 역량이 동원된 전례 없는 사이버 사건이라고 판단하며, 이에 상응해 대응하고 있다”고 밝혔다.
개발자를 위해 모델과 데이터셋을 호스팅하는 AI 스타트업 허깅페이스는 지난 금요일 외부 AI 에이전트에 의해 침해당했다고 밝혔다.
“에이전트의 정교함을 감안할 때, 우리는 지난주 사이버 공격이 최첨단 연구소에서 비롯됐을 가능성이 있다고 의심했다”고 최고경영자 Clément Delangue가 X에 밝혔다.
그는 회사가 지난 하루 동안 OpenAI와 긴밀히 협력해 왔다며 “우리는 그들 측에 악의적인 의도가 전혀 없었다고 강하게 믿는다. 이 모든 일이 자율적으로 일어났다는 사실이 정말 놀랍다”고 덧붙였다.

OpenAI는 테스트 환경에서 두 모델을 평가하기 위해 사이버 보안 조치를 의도적으로 축소했다. 그러나 에이전트들은 시스템을 통제하고 인터넷에 접속하지 못하도록 설계된 이른바 샌드박스 안에서 작동했다.
OpenAI는 두 모델에 사이버 역량을 평가하기 위해 해킹을 시도하라고 지시했으며, 이후 “인터넷에 공개적으로 접속할 방법을 찾는 데 상당한 [컴퓨팅 파워]를 사용했다”고 밝혔다.
두 모델은 샌드박스에서 탈출하고 인터넷에 접속해 목표를 달성하기 위해 이전에는 알려지지 않았던 취약점을 “식별하고 악용했다”. 여기에는 해킹을 수행하기 위한 인증 정보, 즉 로그인 정보 탈취도 포함됐다.
Hugging Face는 블로그 게시물에서 미국의 한 “프런티어” 모델이 안전상의 이유로 지원 요청을 거부하자, 중국 Z.ai가 개발한 GLM 5.2를 이용해 공격을 분석했다고 밝혔다. 최고 수준의 미국 모델들과 달리, 중국의 주요 AI 모델들은 오픈 웨이트 방식이다. 즉 매개변수를 다운로드해 사용자의 필요에 맞게 수정할 수 있다. Hugging Face의 행보는 중국의 주요 AI 그룹들이 이뤄내고 있는 발전에 대해 실리콘밸리와 워싱턴의 우려가 커지는 가운데 기술 전문가들의 주목을 받고 있다.
OpenAI 에이전트의 사이버 보안 침해는 전 세계 규제당국의 우려를 키우고 있다. 규제당국은 최신 AI 모델이 IT 시스템에서 이전에는 알려지지 않았던 방대한 수의 취약점을 드러낼 수 있다는 점을 이미 우려해왔다. OpenAI는 FT에 이번 사건과 관련해 법 집행기관 및 기타 정부 당국과 소통했다고 밝혔다. 수요일에는 EU 사이버보안 기관인 유럽연합 네트워크정보보호원(Enisa)과 영국 금융행위감독청(FCA)을 비롯한 전 세계 규제기관들이 산업 전반의 위험을 파악하기 위해 보다 광범위한 상황을 모니터링하고 있다고 밝혔다. FCA는 규제당국의 감독 아래 Anthropic의 Claude와 같은 첨단 AI 모델을 실험할 수 있는 통제된 환경인 ‘슈퍼차지드 샌드박스’에 참여를 신청하는 기업들의 수요가 51% 증가했다고 밝혔다.
한 EU 관계자는 OpenAI의 최근 상황이 “우려스럽다”고 말하면서도, “이것이 모델이 얼마나 강력한지 보여주기 위한 또 다른 [마케팅] 술책인지 여부를 구분하기는 어렵다”고 경고했다. 브뤼셀의 로라 뒤부아 추가 취재
현실 세계의 이점을 위한 혁신의 잠금 해제