이 글, AI가 썼을까? 점점 구분하기 어려워진다
탐지 소프트웨어는 신속한 답을 제공하지만, 오탐 위험과 혐의를 받는 데 따른 낙인이 사회 전반에 글에 대한 불신을 키우고 있다.

일레인 무어
맥스 스페로는 온라인에서 무언가를 읽을 때, 탐지 소프트웨어로 확인하기도 전에 그것이 AI가 작성한 글인지 직감으로 판단할 수 있다고 믿는다.
구글에서 소프트웨어 엔지니어로 일했던 그는 수년간 머신러닝 분야에 종사했기 때문에 그의 직감은 대부분의 사람보다 더 정교하다. 그가 찾는 것은 대규모 언어 모델의 전형적인 징후인 긴 대시, 환각, 매끄럽고 기분 좋은 어조가 아니다. 대신 공허감이다. 그는 “정보 밀도를 살펴봅니다. 사람이 글을 쓸 때는 모든 단어에 의도가 담겨 있습니다. AI가 텍스트를 생성할 때는 그렇지 않습니다”라고 말한다.
지난 1년 동안 스페로는 AI가 기만적으로 사용되고 있다고 믿는 행태를 지적하는, 규모는 작지만 결의에 찬 자칭 언어 탐정 집단의 일종의 영웅이 됐다.
AI를 이용해 새 웹페이지의 3분의 1 또는 킨들 전자책의 5분의 1이 작성됐다고 주장하는 헤드라인을 접한다면, 연구자들은 대개 Spero의 AI 탐지기 Pangram을 사용했을 가능성이 크다. Pangram은 ‘Shy Girl’ 스캔들의 중심에 있었다. AI를 사용했다는 의혹이 제기되면서 이 소설은 서점에서 회수됐지만, 작가 Mia Ballard는 해당 기술을 사용하지 않았다고 부인했다. 올여름에는 트리니다드 출신 Jamir Nazir가 권위 있는 Commonwealth Short Story Prize에 AI로 작성한 이야기를 제출했다는 의혹을 제기하는 데 사용됐다.
판사, 컨설턴트, 변호사, 신문(《The New York Times》, FT* 및 《The Wall Street Journal》 포함)이 발표한 글도 AI 탐지기에 의해 표시된 사례가 있다. 탐지 소프트웨어를 사용하는 많은 사람은 AI 자체에 반대하는 것이 아니라, AI 사용을 둘러싼 부정직함에 반대한다고 말한다. 출판 플랫폼 Substack의 최고경영자(CEO) Chris Best는 인간이 작성한 것처럼 위장한 AI 콘텐츠가 “공유 자원을 오염시킨다”고 말한다. Substack은 Pangram과 협력해 뉴스레터를 검사하고 있다.
Spero는 때때로 소셜미디어에 개입해 스크린샷을 게시하고 자신의 모델로 글을 분석해주겠다고 제안했다.
그와 공동창업자 Bradley Emi는 스탠퍼드대 동문이자 Tesla의 전 머신러닝 과학자로, 기계가 만든 콘텐츠와 인간이 만든 콘텐츠를 더 이상 구분할 수 없게 된다면 어떤 일이 벌어질지 우려해 2023년 Pangram을 설립했다. 이들의 주장은 AI 시대에 진정성이 그 어느 때보다 가치 있다는 것이다.
그러나 이 쫓고 쫓기는 게임 한가운데에는 인간이 쓴 글과 AI가 쓴 글을 명확히 구분할 수 있다는 데 확신하지 못하는 사람들도 있다. 학생들의 생성형 AI 사용을 모두 지지하는 Oxford, Cambridge, Harvard 등 대학들은 과제를 검사하기 위해 상용 AI 탐지기를 사용하는 것을 지지하지 않는다.
작가들은 AI의 특징으로 흔히 지목되는 표현들이 모두 인간의 글에도 나타나며, AI 탐지 소프트웨어와 직감 모두 틀릴 수 있다고 지적한다. 많은 이들은 잘못된 고발이 초래할 결과를 우려한다. 기술 분야에서 일하는 한 관계자는 2022년 말 OpenAI의 ChatGPT가 출시된 순간 완전한 확실성을 둘러싼 싸움은 이미 패배했다고 말한다.
AI를 사용했다는 의혹을 받은 작가들 중 일부도 반발하고 있다. AI를 사용하는 데 아무런 문제가 없다고 주장하거나, 합성 콘텐츠를 둘러싼 편집증이 마녀사냥으로 이어졌다고 말한다. Nazir는 최종 Commonwealth prize를 수상한 자신의 이야기 The Serpent in the Grove를 쓰는 데 AI를 사용하지 않았다고 거듭 밝혔다. 그는 AI와 Pangram을 불화의 여신 Eris에 비유한다. Eris는 사과 하나를 던져 트로이 전쟁을 촉발한 인물이다.
“우리는 이걸 우리의 모든 언어를 학습하도록 훈련시켰습니다. 그런데 이제는 서로를 믿는 것이 불가능해졌습니다.”라고 그는 FT에 말했다.

저자 출처를 둘러싼 논쟁은 전혀 새로운 일이 아니다. 1세기 로마의 시인 마르티알리스는 자신의 말을 훔쳤다고 비난한 한 시인에게 시를 썼다(플라기아리오, plagiario). 또한 수년 동안 작가들은 대필 작가, 연구 보조원, 편집자에게 자신의 작업을 맡기면서도 그들의 기여를 밝히지 않았다.
지금 다른 점은 규모다. AI가 텍스트를 생성하는 속도와 편의성을 고려하면, 우리가 온라인에서 접하는 콘텐츠 상당수가 인위적으로 생성됐을 수 있다고 보는 것이 합리적이다.
Pangram, GPTZero, Winston AI, Copyleaks 같은 AI 탐지기는 사용자가 의심스러운 발췌문을 입력하면 해당 텍스트가 AI로 생성됐다고 추정되는 비중을 백분율로 보여준다. 제한적인 무료 버전이 제공되며, 구독료는 월 최대 74.99달러에 이를 수 있다.
하지만 이들이 정확히 어떻게 점수를 산출하는지 이해하기는 쉽지 않다. 탐지기 업체들은 어떤 텍스트를 학습에 사용했는지를 비롯해 기술적 작동 방식 전부를 공개하지 않는다. 또한 사용자에게 점수의 정확한 세부 내역도 제공하지 않는다.
대체로 탐지기가 찾는 것은 패턴이다. 자주 언급되는 ‘delve’처럼 AI임을 보여주는 단 하나의 단어가 아니라, 대규모 언어 모델이 내릴 법한 선택과 일치하는 조합을 찾아내는 것이다.
이를 수행하는 방법은 여러 가지다. University of California, Santa Barbara의 연구진은 텍스트를 절반으로 나눈 뒤 AI를 사용해 새로운 결말을 작성하고, 이후 두 부분을 비교하는 ‘Divergent N-Gram Analysis’(DNA-GPT)를 고안했다.
Vrije Universiteit Brussel 연구진이 최근 실시한 탐지기 신뢰성 연구에서 가장 높은 평가를 받은 Pangram은 시간이 더 많이 걸리는 접근법을 택했다. ChatGPT 출시 전에 작성된 수백만 건의 인간 작성 텍스트를 수집했다. 여기에는 Amazon 리뷰부터 시, 장문의 에세이에 이르기까지 다양한 글이 포함됐다. 그런 다음 여러 챗봇으로 ‘합성 거울’ 텍스트를 생성하고, 원문과 생성문 쌍을 모델에 입력해 서로 구분하도록 학습시켰다.
새로운 AI 모델이 등장할 때마다 학습도 업데이트된다. Spero는 “시장에서 다른 업체들보다 나은 수준에 도달하는 데 1년이 걸렸습니다. AI의 도움을 받은 텍스트와 전적으로 AI가 작성한 텍스트의 차이를 연구하는 데 또 1년이 걸렸고요. 이제는 좋은 모델을 갖추게 됐습니다”라고 말했다.

Bellingcat에서 조사 연구원으로 일한 적이 있는 26세 Edward Tian이 개발한 가장 초기의 AI 탐지기 중 하나인 GPTZero는 AI 탐지기가 찾아내는 패턴을 모자이크에 비유한다. 최근 EY와 PwC가 작성한 보고서에서 AI 환각을 식별하는 데 사용된 이 소프트웨어는 AI가 생성한 문서와 인간이 작성한 문서로 학습한 분류기도 활용한다.
AI 탐지를 위해 업로드된 텍스트는 여러 조각으로 나뉘고 토큰으로 처리된 뒤 숫자로 변환된다. 이렇게 변환된 값은 AI가 생성한 텍스트와 인간이 작성한 텍스트에서 산출된 값과 비교돼 단어 선택뿐 아니라 단어의 배치, 빈도, 문장, 문단에서 겹치는 부분이 있는지 확인한다. 텍스트가 많을수록 살펴볼 수 있는 패턴도 많아진다.



AI가 작성한 텍스트의 특징 • 3의 법칙(X, Y, Z) • 뒤에 단어 목록이 이어지는 엠 대시 • ‘X는 할 수 있지만 Y는 할 수 없다’라는 표현 • ‘더 깊은’은 AI가 작성한 글에서 자주 보이는 단어 중 하나
사람이 편집한 텍스트 • ‘from’을 반복해 리듬이 바뀌고 문장이 고르지 않게 됨 • 길게 이어진 문장을 여러 문장으로 나눔
인간화 도구 사용 • 글이 덜 다듬어진 느낌 • 동일한 3의 법칙이 다시 등장 • ‘X는 할 수 있지만 Y는 할 수 없다’라는 표현이 그대로 남아 있음 • 다시 쓴 마지막 부분은 장황하게 이어지는 문장이 됨
이 때문에 주요 탐지기들은 누군가 몇몇 단어를 바꾸거나 문장 일부의 배열을 바꾼 뒤에도 여전히 AI 사용을 포착할 수 있다. 일부 탐지기에는 표절 분석 기능과 AI 이미지 식별 기능도 추가됐다.
탐지 업체의 창업자들은 자신들이 AI 연구소들과 경쟁하고 있다는 사실을 알고 있다. AI 연구소들은 결과물이 최대한 자연스럽게 보이도록 만드는 데 이해관계가 있으며, AI 사용의 명백한 흔적을 없애기 위해 텍스트를 뒤섞고 다시 쓰도록 설계된 ‘인간화’ 도구들과도 경쟁해야 한다.
그러나 진짜 적은 오탐(false positive)이다. 즉, 모델이 인간이 작성한 글을 AI가 생성한 것으로 잘못 판별할 위험이다. 오픈AI는 오탐률이 9%에 이른다고 보고한 뒤 2023년 자체 탐지 프로그램을 중단했다. 2024년에는 한 사용자가 한 탐지기가 미국 독립선언서를 AI가 작성했을 확률 98%로 잘못 판정했다고 주장했다. 널리 보도된 스탠퍼드대 연구에 따르면, 영어가 모국어가 아닌 사람들이 작성한 글은 AI가 생성한 것으로 잘못 판정될 가능성이 더 높았다. 연구진은 그 원인으로 이들의 상대적으로 제한적인 언어적 다양성과 단어 선택을 들었다.
AI 탐지기가 증거를 판단하는 기준, 즉 임계값이 중요한 이유가 바로 여기에 있다.
카네기멜런대 경제학자 브라이언 자바리안은 지난해 9월 팡그램, 오리지널리티AI, GPT제로 등 상용 AI 탐지기 3종을 비교한 연구를 발표했다. 그는 인간이 작성한 텍스트 표본 약 2,000개와 이에 상응하는 AI 생성 텍스트를 입력한 뒤 다양한 증거 임계값을 설정했다. 임계값을 낮추면 AI가 생성한 것으로 판별되는 텍스트는 늘어나지만, 오탐률이 발생할 가능성도 소폭 높아진다.
팡그램은 최신 모델의 오탐률이 0.0041%에 불과하며, 문서 약 2만4,000건당 한 건꼴로 오탐이 발생한다고 말한다. 문제는 우리가 그 한 번의 잘못된 비난 위험을 감수할 의향이 있느냐는 것이다. 자바리안은 “그것은 기술 기업들이 결정할 일이 아닙니다”라며 “사회적 결정입니다”라고 말했다.

나지르는 자신이 억울하게 누명을 쓴 사람들 중 하나라고 주장한다. 그의 단편소설이 5월 카리브해 지역 커먼웰스상을 받은 뒤, 한 익명의 X 계정이 팡그램이 이 작품을 100% AI가 생성한 것으로 판정했다는 내용의 스크린샷을 게시했다.
다른 사람들도 탐지기를 사용하지 않고도 AI가 쓴 글인 줄 알았다고 끼어들었다. 전직 팔란티어 엔지니어인 나빌 S 큐레시는 “나는 약 5초 만에 GPT가 쓴 글이라는 걸 알 수 있었다”고 썼다.
논평자들은 자신들이 AI가 쓴 글임을 드러내는 단서라고 여긴 것들을 지적했다. “벌들의 단정한 부지런함이 아니라 . . . 배 속에서 나는 소리”는 AI가 생성한 글에서 흔히 보이는 “‘x가 아니라 y’”라는 표현 방식이었다. “그녀는 벤치가 사람이 되게 만드는 그런 걸음걸이를 지녔다”는 문장은 무의미한 AI식 은유로 여겨졌고, “고요한 집안일, 인내심 있는 손길, 불이 켜지지 않은 램프”는 AI 텍스트에 전형적인 세 항목 나열 방식으로 받아들여졌다. 몇몇 사람들은 작가 본인이 실재하는 인물인지조차 의심하기 시작했는데, 그의 사진이 기묘할 정도로 좌우 대칭을 이루고 있다는 점을 근거로 들었다.
트리니다드의 햇살 가득하고 식물이 많은 집에서 말하는 나지르는, 그 사진을 좀 더 말끔하게 보이도록 디지털로 수정한 것은 맞지만 자신의 이야기를 AI로 쓴 것은 아니라고 말한다. 예를 들어 벤치에 관한 문장은 무생물마저 살아 움직일 만큼 한 여성이 아름다울 수 있다는 뜻을 표현한 자신의 방식이었다.
그는 “문학적 기법입니다”라고 말한다. “이 독자들은 신비주의를 이해하지 못하는 걸까요? 살만 루슈디의 책 중 하나에는 사람들이 공중을 떠다니는 장면이 나오는데, 그것 역시 실제로 일어난 일은 아니잖아요.”
62세의 은퇴한 공무원인 나지르는 악명 높은 사진 속 모습보다 더 초라해 보인다. 희끗희끗한 수염이 자라 있고, 두꺼운 검은 안경은 이마 위에 걸쳐 두었다. 그는 지난 몇 달간의 일을 설명하면서 천진난만한 재미를 느끼는 듯한 반응(“그 사진 정말 잘 나왔더라고요”)과 자신의 글에 대한 비판에 상처받은 마음, 자신이 AI를 사용했다는 주장에 대한 답답함 사이를 오간다.

그가 응모한 이야기는 사탕수수밭을 지나 학교에 걸어가던 어린 시절의 기억에서 끌어낸 것이라고 그는 말한다. 일부 독자들이 문체가 딱딱하고 작위적이라고 평한 그의 글쓰기 방식은 기술 보고서를 쓰며 보낸 경력과, 인도의 라빈드라나트 타고르와 팔레스타인 시인 마흐무드 다르위시 같은 이들의 시를 평생 읽어온 데서 비롯됐다. 하지만 AI는 아니다. 편집에도 AI를 쓰지 않는다. 그는 “저는 AI를 쓰지 않고 GI를 씁니다”라며 “신의 지능(God’s intelligence)이죠”라고 말한다.
건강 상태가 좋지 않아 신경병증 때문에 타이핑이 어렵고 림프종 치료를 위해 화학요법을 받고 있는 그는 음성-텍스트 변환 도구를 이용해 시와 이야기를 받아쓴다. 하지만 그는 어떤 종류의 AI 글쓰기 도구도 사용하지 않는다고 거듭 말한다.
그의 비평가들은 생각을 바꾸지 않았다. 온라인에서 이 이야기를 비판한 펜실베이니아대학교 와튼스쿨의 AI 연구자이자 부교수인 이선 몰릭은 “매우 분명했다”며 “AI는 많은 일을 잘하지만, 소설을 쓰는 것은 그중 하나가 아니다”라고 말한다.
전자책에서의 AI 사용에 관한 논문의 공동 저자인 뉴욕주립대학교 스토니브룩의 컴퓨터과학과 조교수 투힌 차크라바르티는 이 이야기에 ‘hum’이라는 단어가 여섯 차례 등장한다고 지적한다. 그는 이 단어가 ChatGPT가 소설에서 사용하는 것으로 알려져 있다고 말한다. 그는 AI가 쓴 글을 자신의 글인 것처럼 내놓으려 한다고 생각되는 사람들을 공개적으로 지적하는 데 거리낌이 없다. 그는 “저는 저작권법에 관해 글을 쓰고 있으며, [AI 사용에 대해] 낙인이 있어야 한다고 생각합니다”라고 말한다.
커먼웰스 재단은 조사를 실시했고 나지르를 지지했다. 그러나 문학 잡지 그란타는 더 이상 수상작을 게재하지 않겠다고 발표했다. 그란타의 발행인 시그리드 라우싱은 “현 단계에서는 작품이 진짜인지 아닌지를 판단할 방법이 사실상 없습니다”라고 말한다. 그러면서도 그녀는 AI에 반대하는 것은 아니라고 덧붙인다. “작가가 AI로 생성된 자료를 활용해 실험적인 텍스트를 만들고 이를 투명하게 공개한다면, 작품이 좋을 경우 저는 기꺼이 읽고 출판하겠습니다.”
그러한 실험은 일어날 가능성이 낮아 보인다. 2023년 작가 James Frey는 프랑스 잡지 Pompidou+와의 인터뷰에서 새 책을 집필하는 데 AI를 사용하고 있으며, 어떤 부분을 자신이 썼고 어떤 부분을 AI가 썼는지는 공개하지 않겠다고 말했다. 이 장난스러운 글은 아직 세상에 나오지 않았다.
상업적 업무에서도 같은 침묵이 이어지고 있다. 많은 기업은 AI와 그 긍정적인 효과에 대해 공개적으로 이야기하면서도, 서면 보고서 작성에 AI를 정확히 어떻게 사용했는지는 밝히기를 꺼리는 듯하다. KPMG, EY, PwC, Deloitte가 수행한 업무에서처럼 AI 사용으로 오류가 발생하면 기업들은 비판을 받았다.
“이것이 인간의 실수였다면 비난이 이렇게 거셌을까요?” 런던 Mishcon de Reya의 변호사이자 기술 부문 책임자인 Ashley Williams는 묻는다. “이는 우리 모두가 여전히 AI를 어떻게 사용해야 할지, 어디에 선을 그어야 할지를 알아가는 과정에 있다는 점을 보여준다고 생각합니다.”
한 컨설턴트는 고객들이 AI가 생성한 보고서를 본질적으로 낮은 품질로 여길 것을 기업들이 우려하기 때문에 투명성이 부족하다고 말했다. “[AI는] 정형화된 부분을 작성하는 데는 매우 뛰어나지만, 고객들은 문서를 검토하고 다시 작성할 전문가가 여전히 필요하다는 사실을 깨닫지 못할 수 있습니다. AI가 생성한 텍스트는 무게감이 덜하다는 낙인이 있습니다.”

올해 말 EU는 운동가들이 수년간 요구해 온 AI 텍스트 워터마크 도입을 계획하고 있다. Anthropic은 이미 자사의 새로운 Claude 모델에 육안으로는 알아볼 수 없는 표시가 포함될 것이라고 밝혔다.
그러나 워터마크는 문제를 명확히 하기보다 오히려 더 복잡하게 만들 수 있다. 텍스트를 편집하거나 바꿔 쓰고 복사하는 과정에서 표시가 지워질 수 있기 때문이다. Anthropic은 워터마크가 없다고 해서 AI가 사용되지 않았다는 증거가 되는 것은 아니라고 지적한다.
펜실베이니아대학교 와튼스쿨의 Mollick은 어떤 탐지기나 워터마크도 100% 완벽하지 않다는 사실은 우리가 이미 AI의 ‘K-T 경계’를 넘어섰다는 뜻이라고 생각한다. K-T 경계는 대멸종 사건을 나타내는 지질학적 지표다.
그는 “진정성은 모든 곳에서 문제가 될 것”이라며 “우리는 아직 글쓰기에서 어떤 부분을 인간의 영역으로 남겨둘지, 또 어떤 부분은 AI가 맡아도 된다고 받아들일지를 협의하는 중”이라고 말한다.
행동강령은 계속 바뀌고 있다. 문학을 쓸 때 AI 사용이 용납되지 않는다면, 품질이 높고 절약된 시간이 가격에 반영되기만 한다면 법률 초안이나 감사 보고서처럼 좀 더 실용적인 텍스트에는 AI를 사용해도 되는 것일까? AI가 작성한 이메일은 유용한 도구일까, 아니면 받는 사람에 대한 모욕일까? AI가 작성하거나 편집한 초안은 언제나 공개해야 할까? 직감과 탐지기에 근거한 AI 사용 의혹이 더 강력한 감시와 의미의 왜곡으로 이어지지는 않을까?
“미래는 인간의 글쓰기와 AI 글쓰기가 균형을 이루는 형태가 될 것이라고 생각합니다”라고 AI 탐지기 GPTZero의 창시자 Tian은 말한다. 그는 더 많은 사람들이 AI를 일상에 통합할수록 표절 의혹도 잦아들 것이라고 믿는다. 그러나 기계가 매개하지 않고 서로 소통할 방법을 여전히 찾아야 한다고 그는 말한다.
“글쓰기는 단순한 결과물 그 이상입니다. 글쓰기는 우리의 비판적 사고를 반영합니다”라고 그는 말한다. “글쓰기에는 보존할 가치가 있는 아름다운 무언가가 있습니다.”
*FT 편집 실무 규정은 생성형 AI 도구를 기사 또는 게재할 기사 원고를 작성하는 데 사용해서는 안 되며, 그 밖에 독자에게 제공되는 콘텐츠를 만드는 데도 사용해서는 안 된다고 명시한다.

AI로의 전환, 프리미엄, 목요일
존 번머독과 세라 오코너가 AI가 일의 세계를 어떻게 재편하고 있는지 엄밀하게 심층 분석하는 주간 특집