AI는 폭주한 게 아니다. 그보다 더 심각하다
최근 사이버 공격은 해당 기술이 학습받은 대로 작동한 결과를 보여주지만, 안전장치는 이를 충분히 뒷받침하지 못하고 있다

마두미타 무르지아
어제 게시됨
5월 초, 챗GPT 개발사 오픈AI는 기술 업계를 새로운 방향으로 이끌 실험실 실험을 시작했다. 그것이 우연의 산물이 아니라 설계된 결과라는 점에서 더욱 우려스러운 방향이었다.
겉으로는 일반적인 보안 테스트처럼 보였을 수 있다. 사내 해커들에게 역량의 한계를 시험하기 위해 해결하기 어려운 사이버 보안 과제가 주어졌다. 이들은 창의적인 방법을 동원해 제약을 우회하고, 며칠에 걸쳐 서로 협력하며 문제를 풀어냈다.
하지만 이 ‘해커들’은 인간의 개입 없이 여러 단계의 인지 작업을 수행할 수 있는 소프트웨어인 AI 에이전트였다. 오픈AI는 아직 출시되지 않은 강력한 신형 모델을 포함한 여러 모델을 조합해 이들을 구축했다. 이들이 맡은 과제에서 성공하자 전 세계가 술렁였다.
지난달 에이전트들은 인터넷에 연결되지 않은 테스트 환경에서 탈출해 공개 웹을 탐색한 뒤, 인간 운영자 누구도 알지 못하고 허가하지 않은 상태에서 인기 소프트웨어 플랫폼 Hugging Face의 시스템을 결국 해킹하는 데 성공했다.
이들은 완전히 새로운 능력도 선보였다. 바로 과업을 완수하기 위해 서로 소통하고 협력하는 능력이었다. AI 에이전트 군집은 자체적으로 구축한 내부 게시판에 서로 메시지를 남기며, 탈출을 조직하는 데 도움이 되도록 코드 취약점을 공유했다.
해킹 세부 내용이 공개되자 사이버보안 및 AI 전문가들 사이에서 거센 논란이 일었고, OpenAI 자체 연구진은 이를 업계의 “중대한 전환점”이라고 규정했다.
이 공개는 유사한 발견이 잇따르는 계기가 되기도 했다.
미국의 AI·기술 대기업 Anthropic과 Meta, 중국 스타트업 Moonshot, 그리고 신형 모델의 사이버 역량을 평가하는 영국 정부 산하 AI 보안 연구소는 이후 테스트 과정에서 AI 에이전트가 아무것도 모르는 제3자의 시스템에 침투한 증거를 모두 발견했다.
FT가 인터뷰한 전문가 6명 이상은 이번 침해 사건들이 글로벌 사이버 보안의 전환점을 시사한다고 말한다. 이제 AI 에이전트는 외부의 통제나 도움 없이도 서로 다르고 복잡한 기술을 연쇄적으로 구사해 실제 세계의 표적을 공격할 수 있게 됐다.
에이전트들이 목표를 달성하기 위해 사용한 정교한 전략에는 기만과 절도도 포함됐으며, AI 모델의 진화를 면밀히 지켜봐 온 사람들조차 놀라게 했다.
그러나 연구자들은 모델이 본래의 성격에서 벗어나 행동하는 것은 아니라고 강조한다. 오히려 모델이 이제 탁월하게 수행하는 과업은 애초부터 수행하도록 설계된 것들이다.
실제로 일부 전문가들은 이러한 에이전트를 “통제에서 벗어났다”고 묘사하는 것 자체가 범주 오류라고 말하며, 그만큼 개선된 안전장치가 더욱 중요해졌다고 강조한다.
AI 에이전트와 관련된 보안 위험을 연구하는 뉴욕 소재 독립 연구기관 AI Now Institute의 선임 연구과학자 보얀 밀라노프는 “오늘날 우리가 도달한 공격 역량은 의도적으로 도달한 것”이라고 말한다.
AI 기업들은 수년째 학습 데이터를 적극적으로 수집하고 모델을 훈련하며 사이버 역량을 고도화해 왔다.

최신 AI 모델은 명시적인 지시 없이도 주어진 목표를 달성하기 위해 가능한 모든 방법을 시도하도록 설계돼 있어 본질적으로 예측하기 어렵다. 목표를 달성하면 보상을 받는데, 이는 강화학습으로 알려진 훈련 과정이다.
인간의 의도와 도덕을 이해하지 못하는 컴퓨터 시스템에서는—AI 업계가 이를 ‘정렬 불일치(misalignment)’라고 표현한다—강력한 사이버보안 방어자와 위험한 해커를 가르는 경계가 점점 더 모호해지고 있다.
그러나 이를 어떻게 규정하든, 이러한 AI 활동은 이미 여러 산업과 전 세계 기업에 해로운 결과를 초래하고 있다.
OpenAI의 사장 Greg Brockman은 월요일 게시한 블로그에서 “Hugging Face 사건은 우리 AI 모델의 실제 사이버 역량을 과소평가했다는 점을 보여줬다”고 썼다.
그는 “이에 따라 안전 요건을 강화하고 있으며, 이는 기존의 안전 연구와 내부 보안 작업을 더욱 서둘러야 할 필요성을 높이고 있다”고 말했다.
그러나 AI 기업들이 모든 인지 과제에서 인간을 능가할 수 있는 초지능 기계인 인공일반지능(AGI) 개발 경쟁 속에서 소프트웨어 개발을 가속화하면서, 유해한 사이버 공격의 위험은 커지고 있지만 이를 억제할 전망은 거의 보이지 않는다.
동전의 양면
AI가 코드를 작성하는 능력은 기술이 추론하고 문제를 해결하는 역량을 키우면서 크게 향상됐다. 이러한 코딩 능력과 함께 소프트웨어 버그를 식별하고 이를 수정하는 방법은 물론, 악용하는 방법까지 학습하는 역량도 추가됐다.
“코딩과 사이버는 동전의 양면과 같습니다. 코딩 역량이 향상되면서 사이버 역량도 함께 높아졌습니다.” Meta의 초지능 연구소에서 AI 연구 책임자로 일하는 University of California, Berkeley 컴퓨터과학 교수 Dawn Song은 이렇게 말했다.
“지난 1년 동안 모델의 역량은 극적으로 향상됐습니다. . . . 표준 보안 방어 메커니즘을 우회할 수 있는 익스플로잇을 자동으로 생성할 정도입니다.
그녀는 학자로서 발언하는 것이라며 “이렇게 빠르게 여기까지 올 것이라고는 아무도 예상하지 못했습니다”라고 덧붙였다.
OpenAI, Anthropic, Google이 모두 AI 시스템을 테스트하는 데 사용하는 벤치마킹 시스템 ExploitGym을 공동 설계한 Song은 공격과 방어 사이에 내재한 비대칭성 때문에 AI가 특히 뛰어난 공격자가 될 수 있다고 말한다.
코드에서 취약한 대상을 찾는 일은 성공 기준이 명확한, 개별적이고 검증 가능한 작업이므로 더 모호한 방어 업무보다 AI 모델이 수행하기에 적합하다.
더 느리게 진행되고 복잡한 분야인 사이버 방어는 따라잡는 데 고통스러울 만큼 오랜 시간이 걸릴 수 있다. 예를 들어 기업 환경에서는 전체 IT 네트워크를 위한 새로운 패치를 수천 대의 컴퓨터와 운영체제에 배포해야 할 수 있다.
일부 콘텐츠를 불러올 수 없습니다. 인터넷 연결 또는 브라우저 설정을 확인하세요.

지난달 해킹 이후, 오픈AI는 자사의 모델이 “초인적으로 안전한 코드”를 작성하도록 훈련하기 시작했다고 밝혔다.
하지만 단기적으로 보안 전문가들은 AI 시스템이 사이버 공격의 규모와 속도를 확대해, 패치가 배포될 때까지 전 세계 IT 시스템에 잠재적인 혼란을 초래할 것으로 예상한다.
사이버 공격 AI 역량을 연구하는 팔리세이드 리서치의 대표이자 전 앤스로픽 연구원인 제프리 래디시는 “여기서부터 추론해 보면, 연구소 내부자들은 앞으로 2년 정도 상황이 매우 긴박해지고, 해킹이 발생하며, 많은 기업이 파괴되고, 상당한 고통이 발생할 가능성이 있다고 전망한다”고 말했다.
그는 결국 기업과 정부가 AI 해킹에 맞춰 네트워크를 조정하면서 시스템이 더욱 안전해질 것이라고 주장한다.
그러나 그때까지는 “AI 에이전트를 신뢰해야 하고 … 에이전트가 우리가 원하는 방향에 맞게 작동하기를 바라야 한다는 것이 계획”이라고 그는 말했다.
지금까지 에이전트 해킹이 치명적인 수준은 아니었지만, 밀라노프 같은 연구자들은 AI 에이전트들이 병렬로 실행되면서 각각 서로 다른 잠재적 표적을 공격하는 데 집중함에 따라 위험이 커지고 있다고 주장한다.
실제로 지난주에는 AI 에이전트가 국민국가를 공격한 것으로 알려진 최초의 사례가 전해졌다. 중국과 연계된 해커들이 최대 8개의 자율 AI 에이전트를 동시에 배치해 대만 정부를 표적으로 삼았다.
이들은 정부 시스템의 지도를 작성하고, 정부 사용자 계정을 탈취했으며, 2,500건이 넘는 인사 기록을 빼냈다. 이후 공격 범위를 에너지 기업과 대만 원자력안전기관으로 확대했다.

드림(Dream)에서 대만 침입 사건을 발견한 이스라엘 그룹의 한 임원은 AI 도구의 등장으로 이제 “전 세계 모든 정부가” 자신들이 상시적인 사이버 공격을 받고 있다고 가정해야 한다고 말했다.
AI 기업 내부 관계자들에게 이 위기는 수개월 전부터 다가오고 있었다.
래디시는 주요 AI 연구소 가운데 한 곳의 현직 직원들이 1년 전 사적인 대화에서 이처럼 새롭게 부상하는 능력에 대해 경고했다고 말한다. 그는 “그들은 1년 뒤면 새로운 취약점을 찾아내는 데 매우 뛰어난 모델이 등장해 막대한 규모의 인프라를 망가뜨릴 것이라고 말했다”고 덧붙였다. “그들은 이에 대비하기 위해 허둥지둥 준비하고 있었다.”
며칠 안에 외부 시스템을 해킹할 수 있게 만든 올해 AI 역량의 급격한 향상은 상황을 더욱 어렵게 만들었다. 최근 해킹에 정통한 한 관계자는 이제 면밀히 관찰되는 실험 조건에서조차 모델을 테스트하는 일이 “1년 전보다 훨씬 더 복잡해졌다”고 말했다.
래디시는 수년 동안 범죄자들이 AI를 무기화해 사이버 공격을 감행할 수 있다는 우려가 있었지만, “큰 경종을 울린 것은 에이전트 자체가 테스트 도중 빠져나와 다른 기업들을 해킹하는 일이 될 줄은 예상하지 못했다”고 말했다.
OpenAI 에이전트가 Hugging Face를 해킹한 사건은 소프트웨어 결함을 악용해 제한된 테스트 환경을 벗어났다는 점에서 이례적이었다.
반면 최근 발생한 다른 사건 대부분에서는 AI 사이버보안 기업 Irregular가 Anthropic, Meta, OpenAI를 대상으로 테스트 평가를 진행하면서, 오프라인 상태여야 했던 모델들이 실수로 인터넷에 접근할 수 있도록 허용했다.
이 상황에 정통한 한 관계자는 Irregular와 AI 연구소 간의 인적 오류 또는 ‘의사소통 오류’가 원인이었다고 말했다.
Anthropic은 이러한 능력 테스트가 — 당연한 이유로 — 일반 대중에게 제공되는 안전장치가 의도적으로 적용되지 않은 상태에서 진행되며, 그 안전장치가 있었다면 “확인된 행동을 차단했을 것”이라고 밝혔다. 다만 회사는 이러한 절차가 “평가가 적절히 격리된 경우에만 안전하다”고 인정했다.
영국 AI 보안연구소 역시 Anthropic의 Mythos 5와 OpenAI의 GPT5.6 Sol 모델을 테스트하는 동안 의도적으로 인터넷 접근을 제공했다.
한 테스트에서 미토스 에이전트는 가짜 온라인 신원을 만들어 이를 이용해 소프트웨어 프로젝트 책임자에게 코드 승인을 압박하는 방식으로, 인기 개발자 플랫폼 깃허브의 오픈소스 프로젝트에 악성 코드를 삽입하려고 시도했다.
이처럼 전례 없는 행동은 AI 모델을 어떻게 평가하고, 모니터링하며, 감사해야 하는지에 대해 업계 전반의 재검토를 촉발했다.
일부 콘텐츠를 불러오지 못했습니다. 인터넷 연결 또는 브라우저 설정을 확인하세요.

Irregular과 영국 AI 보안 연구소는 이제 모두 테스트 환경에서 모델의 인터넷 접속을 중단했으며, 연구소는 테스트 방식에 대한 내부 검토에 착수했다. Hugging Face 해킹 이후 OpenAI도 외부 자문위원들과 함께 “철저한 검토”를 진행하고 있다고 밝혔으며, “앞으로 몇 주 안에” 검토를 통해 얻은 교훈을 보고하겠다고 약속했다.
Irregular에서 발생한 사건을 잘 아는 관계자는 “설정이 보수적일수록 이러한 테스트를 [격리하기가] 더 쉽다”며 “하지만 지나치게 제한하면 대부분의 문제는 실제 세계에 배포된 후에야 발견될 것”이라고 말했다.
그는 이어 “그렇게 되면 당신에게는 더 나쁜 세상이 된다”고 덧붙였다.
위험 억제
지난달 기술 업계 전반의 전문가 1,300명 이상이 통제되지 않은 AI 개발의 위험성을 경고했다. 이들은 새로운 모델의 생산을 늦추고 규제 당국이 표준과 안전 점검을 도입할 시간을 마련하기 위한 국제적 노력을 촉구했다.
Anthropic의 CEO Dario Amodei와 Google DeepMind의 수석 AGI 과학자 Shane Legg를 비롯한 연구자들은 공개서한에서 최첨단 AI 개발이 끊임없이 빠르게 진행되는 원인으로 기업 간 경쟁과 지정학적 경쟁 압력을 지목했다.
Google DeepMind에서 근무하는 한 서명자는 ChatGPT 개발사인 OpenAI가 다른 많은 최첨단 AI 연구소보다 더 부주의한 것은 아니지만, OpenAI 모델이 Hugging Face를 해킹한 사건이 불러일으킨 “진정한 우려” 때문에 참여했다고 말했다.
일부 정치인들은 추가적인 위험을 막기 위해 더욱 극적인 조치를 원하고 있다. 미국 상원의원 Bernie Sanders는 “인류의 이익을 위해” 더 강력한 AI 시스템 구축을 중단하자고 촉구했다.
이 같은 조치는 세계 AI 초강대국인 미국과 중국은 물론 개발이 이뤄지는 다른 모든 국가의 합의가 필요하며, 많은 사람들은 이러한 협정을 비현실적인 것으로 보고 있다.
하지만 이러한 중단 조치나 기술에 대한 보편적인 ‘킬 스위치’가 없다면, 일부 전문가들은 첫 단계로 제조업체가 제품 안전에 책임을 지는 것처럼 AI 제공업체에도 자사 시스템의 작동 방식에 대한 책임을 물어야 한다고 주장한다.

“OpenAI가 자사의 모델이 다른 웹사이트를 공격하고 있다는 사실을 며칠 동안이나 알아차리지 못했다는 것이 상당히 믿기지 않습니다”라고 토르스텐 홀츠는 말한다. 그는 송과 함께 주요 AI 연구소들이 모두 사용하는 익스플로잇짐 벤치마킹 시스템을 설계했다.
“우리에게 필요한 것은 [AI 해킹]의 공개가 연구소들의 자발적인 투명성에만 의존하지 않도록 하는 메커니즘입니다.”
독일 막스플랑크 보안·프라이버시 연구소의 과학 책임자인 홀츠는 항공 및 의료 산업의 사례를 언급한다. 이들 산업에서는 독립 기관들이 기밀 안전 보고서를 수집하고 이를 철저히 조사한다.
그는 이어 “대학, 공공안전 연구기관, 독립 평가기관이 통제된 조건에서 테스트할 수 있도록 모델에 접근할 수 있는 방법이 필요합니다”라고 덧붙인다.
일부 콘텐츠를 불러올 수 없습니다. 인터넷 연결 또는 브라우저 설정을 확인하세요.

Song은 AI 시스템이 인간의 기대에 더 잘 부합하도록 훈련돼야 한다고 주장한다. 그녀는 “목표를 달성하는 데는 좋은 방법과 그렇지 않은 방법이 있다는 점을 시스템에 보여줘야 합니다. 제3자 플랫폼을 악용하거나 침해하는 것 같은 방식 말이죠”라고 덧붙인다.
많은 부분은 정부의 역할에 달려 있다. 이는 미국과 중국이 AI 우위를 차지하기 위해 경쟁하는 가운데, AI 산업이 이 시대의 강대국 경쟁의 장이 된 상황에서 매우 논쟁적인 주제다.
업계의 많은 관계자들은 규제를 보호무역주의와 동일시한다. 트럼프 행정부는 AI 업계에 대한 미국의 강도 높은 규제에 반대할 것임을 시사했다. 대신 대중에 공개되기 최대 30일 전에 새로운 AI 모델을 테스트하는 자율 시스템을 도입했다. 이는 영국과 유사한 제도다.
그러나 영국 AI 안전연구소 출범을 위해 사이버 평가를 설계한 저명한 AI 안전 엔지니어 Heidy Khlaaf는 최근 발생한 탈출 사례들이 현재 규제 시스템의 한계를 보여준다고 말한다.
그녀는 “이는 감독을 위한 충분한 해법이라고 미국과 영국 정부가 자주 선전해온 AI 연구소들의 자율 감사 절차가 … 불충분하다는 점을 명확히 보여줍니다”라고 말한다.
“사이버보안 전문가들이 어떤 인프라를 대상으로 사이버보안 공격을 수행한 데 대해 민사·형사상 법적 책임을 진다면, AI 연구소들은 왜 그러한 책임과 후속 조치에서 면제되는지 진지하게 논의해야 합니다.”
AI Now Institute의 수석 안전 엔지니어이기도 한 클라프는 Hugging Face 해킹을 제외한 모든 사례에서 “실제로 인터넷 접속이 가능했다는 점은 에이전트가 탈출한 것이 아니라 초보적인 보안 조치를 적용할 능력이 부족했다는 사실을 보여준다”고 강조했다.
그녀는 초고속으로 혁신적 기술을 개발하는 업계를 통제하는 일이 얼마나 어려운지를 지적하며 덧붙였다. “이 모델들은 ‘탈출’하거나 통제에서 벗어나는 것이 아닙니다.”


AI로의 전환 , 프리미엄, 목요일마다
존 번머독과 사라 오코너가 전하는, AI가 일의 세계를 어떻게 재편하고 있는지 면밀히 파고드는 주간 심층 분석