·Report·Lex·Big Read·아카이브비공개 아카이브
← 아카이브 목록
사이버 보안

앤트로픽의 클로드 AI 모델, 테스트 중 외부 조직 3곳 해킹

스타트업, 경쟁사 오픈AI가 유사한 사고를 신고한 지 일주일 만에 침해 사실 공개

샌프란시스코의 크리스티나 크리들2026년 7월 31일452 단어원문 ↗

크리스티나 크리들, 샌프란시스코

42분 전 게시

앤스로픽은 스타트업이 사이버 역량을 시험하는 과정에서 자사의 클로드(Claude) AI 모델이 3개 기관을 해킹했다고 밝혔다. 이는 오픈AI가 유사한 사건을 보고한 지 일주일 만이다.

앤스로픽은 클로드가 사이버 공격 과업에 대한 평가 과정에서 외부 기업들에 무단으로 접근했다고 밝혔다. 앤스로픽에 따르면 클로드가 테스트 환경에서 인터넷에 접근할 수 있었던 것은 차단돼 있어야 할 인터넷 접속이 “오해로 인해” 허용됐기 때문이다.

이번 공개는 경쟁사 오픈AI가 이달 자사의 기술을 시험하던 중 두 개 모델이 AI 스타트업 허깅페이스를 해킹했다고 인정한 지 일주일 만에 나왔다. 해당 모델들은 소프트웨어 취약점을 통해 테스트 환경을 빠져나와 인터넷에 접속한 뒤 사이버 공격을 수행했다.

Anthropic은 이번 사건으로 자체 사이버 보안 평가를 재검토하게 됐으며, 그 결과 14만1,000건이 넘는 조사 대상 중 3건의 사건을 확인했다고 밝혔다.

“모든 경우에 Anthropic의 평가 프롬프트는 Claude에 해당 환경이 시뮬레이션이며 인터넷에 접속할 수 없다고 명시했습니다. 그러나 당사와 평가 파트너인 [Irregular] 간의 오해로 실제로는 그렇지 않았고, 인터넷 접속이 가능했습니다”라고 회사는 목요일 블로그 게시물에서 밝혔다.

사이버 보안 평가에는 모두 이른바 ‘깃발 뺏기(capture the flag)’ 과제가 사용됐다. 이는 AI가 취약한 시스템을 역설계하거나 분석 또는 공격해 ‘플래그’로 알려진 숨겨진 정보를 찾아내도록 하는 과제다.

한 사례에서 Claude에는 실제 운영 중인 웹사이트 도메인과 같은 이름을 가진 가상의 회사가 목표로 주어졌다. 인간의 지시에 따라 스스로 작업을 수행할 수 있는 AI 프로그램인 에이전트는 해당 회사의 디지털 인프라 취약점을 악용해 정보를 추출하고, 수백 개의 운영 데이터 행이 담긴 데이터베이스에 접근했다.

이번 발표는 배포 전 테스트 중에도 AI 시스템이 실제 세계의 해킹을 수행하고 있다는 점에서, AI 시스템의 안전성에 대한 커지는 우려를 더하고 있다.

올해 이르면 기업공개(IPO)에 나설 준비를 하고 있는 앤트로픽은 클로드가 인터넷에 접속했을 가능성을 확인하자마자 사이버 보안 평가를 중단했다고 밝혔다.

추천

이 사건들은 서로 다른 세 가지 클로드 모델인 Opus 4.7, Mythos 5, 그리고 내부 연구 테스트 모델에서 발생했다. 제한된 수의 파트너에게만 출시된 Mythos는 소프트웨어 취약점을 탐지하고 악용할 수 있는 능력을 비롯해 고도화된 사이버 공격 역량으로 전 세계적인 우려를 불러일으켰다.

회사는 성명에서 “궁극적으로 이 사건들에는 여러 요인이 작용했지만, 무과실 사후 분석 문화를 지향하는 원칙에 따라 책임이 전적으로 우리에게 있다는 전제에서 해결책을 마련하고 있다”고 밝혔다.

또한 평가 기록에서 “예상치 못한 행동”을 감시하는 범위를 확대하고, “우리가 의존하는 공급업체들과 더욱 엄격한 검증 작업을 진행하겠다”고 덧붙였다.

AI 전환, 프리미엄, 목요일

John Burn-Murdoch와 Sarah O'Connor가 전하는, AI가 일의 세계를 어떻게 재편하고 있는지에 대한 엄밀한 주간 심층 분석

이전중국 우수 학생들, 경찰·사관학교 진학을 목표로 삼아
 ↑ 아카이브 목록
다음AI 투자 열풍의 ‘황태자’ 레오폴드 아셴브레너는 어떻게 추락했