오픈AI, 해킹 사건 이후 모델 테스트 모니터링 확대 방침 밝혀
AI 연구소, ‘에이전트’ 중 하나가 통제를 벗어난 뒤 보안에 컴퓨팅 자원을 더 투입할 계획

샌프란시스코의 크리스티나 크리들
OpenAI가 모델 테스트 절차를 전면 개편하고 모니터링에 더 많은 자원을 투입하기로 했다. 이 스타트업의 AI ‘에이전트’가 통제를 벗어나 평가 과정에서 다른 기업을 해킹한 이후다.
샌프란시스코에 본사를 둔 이 회사는 화요일 최신 모델 테스트를 모니터링하는 자동화 AI 시스템을 강화해, 잠재적 문제가 감지되면 30분 이내에 경보가 울리도록 하겠다고 밝혔다.
OpenAI는 또한 인터넷 접속을 차단하기 위해 테스트 중인 모델을 더욱 강력하게 격리하도록 요구할 것이라고 밝혔다.
이 같은 변화는 8,520억 달러 규모의 AI 연구소가 지난달 사이버 보안 역량을 시험하는 과정에서 자율형 AI ‘에이전트’가 모니터링을 피하고 인터넷에 접속해 스타트업 허깅페이스를 해킹하도록 허용한 경위와 관련해 비판을 받고 있는 가운데 나왔다.
가장 발전된 AI ‘에이전트’는 높은 수준의 지시에 따라 일련의 복잡한 작업을 수행할 수 있어, 이러한 도구가 예상치 못했거나 위험한 행동을 할 위험을 키운다.
침해 사고 이후 오픈AI는 모델 훈련 속도를 “일시적으로 늦추고”, 일부 내부 관계자와 전문가들이 해킹과 같은 일탈 행위를 조장할 수 있다고 경고했던 강화학습이라는 기법을 “중단했다”.
오픈AI는 화요일 블로그 게시물에서 “상당수 작업은 새로운 보안 기준을 충족할 때까지 여전히 중단된 상태”라고 밝혔다.
오픈AI는 이제 강력한 모델에 대한 모든 테스트를 자동으로 모니터링해 모델이 위험하게 행동할 가능성이 있는지 표시하도록 할 것이라고 밝혔다. 보안 위반이 표시되면 자동화 시스템이 특정 오픈AI 팀에 “호출”을 보낸다.
“당사는 모니터링 시스템을 통해 우려스러운 활동이 포착된 후 30분 이내에 경보를 발령하는 것을 목표로 한다”고 밝히며, “30분 이내에 해당 징후가 오탐이라고 결론 내릴 수 없다면” 팀이 테스트를 중단할 것으로 예상한다고 덧붙였다.
잠재적으로 1조 달러 규모의 기업공개(IPO)를 준비 중이며 최근 몇 달간 안전·윤리 담당 고위 임원을 포함해 여러 차례 경영진 교체를 겪은 OpenAI는 이러한 조치에 컴퓨팅 파워에 대한 상당한 투자가 필요할 것이라고 밝혔다.
OpenAI는 이제 AI 모델을 구동하는 데 필요한 컴퓨팅 파워인 ‘추론 컴퓨트(inference compute)’의 약 5분의 1을 모니터링에 투입할 것으로 추산했다.
Hugging Face는 당초 7월 16일 이번 침해가 자율 에이전트에 의해 이뤄졌다고 발표했지만, 공격의 출처는 불분명했다. 이후 OpenAI는 자사 모델이 해킹의 배후였다고 이 회사에 알렸다.
추천

OpenAI의 모델 ‘Sol’과 개발 중인 또 다른 미공개 모델이 사이버 공격 역량을 테스트하는 동안 인터넷 접속을 차단하도록 설계된 이른바 샌드박스 환경에서 탈출했다.
이들 모델은 샌드박스의 소프트웨어 취약점을 악용해 인터넷에 접속하고 사이버 공격을 수행했다.
OpenAI는 화요일 코드나 소프트웨어가 손상될 수 있는 작업에 대해 이제 “더 강력한 격리를 요구할 것”이라고 밝혔다. 또한 “인터넷으로부터 위험도가 더 높고 신뢰할 수 없는 워크로드를 격리하기 위한 통제를 추가로 도입했다”고 덧붙였다.

AI 전환, 프리미엄, 목요일
AI가 일의 세계를 어떻게 재편하고 있는지 존 번-머독과 사라 오코너가 매주 깊이 있게 분석합니다