·Report·Lex·Big Read·아카이브비공개 아카이브
← Big Read 목록
인공지능

의료 AI는 입증 문제를 안고 있다

이 기술의 발전은 아직까지 실제 의료 현장의 큰 개선으로 이어지지 못하고 있다

런던에서 Sarah Neville2026년 9월 18일2090 단어원문 ↗

게시됨 2시간 전

케일라 세크레스트(Kayla Secrest)는 미시간주의 한 병원에서 수련 프로그램을 시작하던 초년 의사였을 무렵, AI와의 첫 좌절스러운 조우를 겪었다.

병원 경영진은 환자 기록을 15분마다 검토해 패혈증의 위험 신호가 감지되면 경보를 보내도록 설계된 알고리즘을 도입했다. 루틴하면서도 지극히 중요한 업무를 자동화하는, AI 업계가 내세우기를 좋아하는 바로 그런 혁신이었다.

하지만 그것이 그녀의 업무 부담을 덜어줄 거라는 기대는 곧 물거품이 되었다. "몇 달이 지나면서 '어머, 이 경보가 내 환자 한 명 한 명 전부에게서 뜨고 있구나' 하고 깨달았고, 이내 눈이 멍해지기 시작했어요"라고 그녀는 회상하며, 이를 우화 속에서 '늑대가 나타났다'고 외치던 소년에 비유했다.

결국 그녀와 동료들은 이 도구에 대한 믿음을 잃었고, 알림이 뜨더라도 더 이상 환자 병상으로 서둘러 달려가지 않았다. 그 후에야 그녀는 이 도구가 병동이나 응급실이라는 현실의 복잡하고 혼란스러운 환경에서 충분한 테스트를 거치지 않은 채 수백 개 병원에 도입되었음을 알게 되었다.

AI가 의료에 미치는 영향에 대해 거창한 기대가 제기되어 왔으며, 일에 쫓기는 많은 의사와 병원들은 AI가 늘어나는 의료 서비스 수요를 상쇄할 수 있기를 희망하고 있다.

그러나 Secrest 등의 경험은 AI 개발자와 의료 전문가 사이에 격차가 있음을 보여준다. AI 도구가 실험실이라는 인위적 환경에서 예측 불가능한 현장 의료의 세계로 넘어간 뒤 벌어지는 일에 대해서는 독립적인 감독이 대체로 거의 이루어지지 않는다.

전문가들은 경우에 따라 이러한 감독 부재가 환자에게 실질적인 위험을 초래한다고 본다. 또한 이로 인해 특정 도구가 치료를 개선한다는 점을 입증하거나, 그 도구에 이루어진 투자의 정당성을 뒷받침하기가 더 어려워질 수도 있다.

프랭클 심혈관 센터 실내 정원에 있는 흰 가운 차림의 Kayla Secrest
미시간 주에서 활동하는 의사 케일라 세크레스트는 병원 경영진이 필수적이라고 여긴 임상 AI 도구가 실제로는 '양치기 소년'과 다름없었다고 말한다 © Steve Koss/FT

예일 디지털 윤리 센터의 부연구과학자이자 과거 영국 보건사회부 AI 담당관을 지낸 제스 몰리(Jess Morley)는 기술 기업들이 "통계적 검증", 즉 도구의 임상 효능이 아닌 정확성에 초점을 맞추는 경향이 있다고 말한다.

"하지만 의료 분야에서 우리가 진정으로 관심을 두는 것은 두 번째 부분입니다. AI가 실제로 환자 치료 결과에 영향을 미치는지 알고 싶은 것이죠. 그런데 AI가 실제로 환자 치료 결과에 영향을 미친다는 증거는 놀랍도록 턱없이 부족합니다."

AI 옹호자들은 의료 분야에서 AI가 다른 부문보다 빠른 속도로 도입되고 있으며, 필기 작업 자동화 등을 통해 의사의 행정 업무 부담을 덜어주는 방식으로 의료를 개선하고 있다고 주장한다. AI 칩 설계 기업 엔비디아(Nvidia)의 헬스케어 부문 책임자 킴벌리 파월(Kimberly Powell)은 지난 6월 "임상의들이 타이핑에 빼앗겨 온 지 이미 10년이 넘었다는 사실은 극명하게 드러나 있다"고 말했다.

오픈AI(OpenAI)에 따르면 미국 병원 네트워크 어드벤트헬스(AdventHealth)는 ChatGPT for Healthcare를 사용해 특정 행정 업무에 소요되는 시간이 80% 줄었다고 보고했으며, 케냐의 펜다 헬스(Penda Health)와의 협업에 대한 독립적 검토에서는 AI 어시스턴트를 사용하는 임상의들의 진단 오류가 16% 감소한 것으로 나타났다.

그 밖의 잠재적 활용 분야로는 웨어러블 기기를 이용한 환자 모니터링, 대규모 데이터세트를 분석해 향후 질병 발생 가능성을 예측하는 일, 신약 개발 과정의 가속화 등이 있다.

진단 및 영상 촬영과 같은 일부 분야에서는 AI가 미치는 영향에 대한 증거가 이미 부정할 수 없다. 스크립스 연구 변환 연구소(Scripps Research Translational Institute)를 이끄는 에릭 토폴은 2024년 연구를 인용하는데, 이에 따르면 소화기내과 전문의가 AI의 도움을 받아 시행한 대장내시경 검사는 AI 없이 진행한 검사보다 폴립을 훨씬 많이 발견했다.

몸통, 척추, 내부 장기를 상세히 보여주는 3D 자기공명영상(MRI) 스캔
임상 AI 도구는 MRI 스캔 분석 등 진단 및 영상 분야에서 가능성을 보여왔지만, 그 이득이 위험보다 큰지는 항상 명확하지 않다 © Zoonar/Stanislav Rishnyak/Alamy

하지만 검증된 실적을 지닌 도구를 채택하기는커녕, 의료계 관리자들이 생성형 AI의 '와우 효과'에 매료됐다고 토폴(Topol)은 지적한다. 2022년 ChatGPT 출시로 그 서막이 열린 이 발전은 기술이 예컨대 방대한 의학 문헌을 요약해 의사의 의사결정을 돕는 일까지 할 수 있게 했다.

규제의 공백과 성과 데이터 부족으로 인해 생성형 AI의 이득이 위험보다 큰지 판단하기 어렵다. 지금 시급한 과제는 ‘그 이득 대비 피해 비율을 … 실제 의료 현장에서 입증하는 것’이라고 그는 제안한다.

토폴은 주요 AI 기업들이 모델 개발 이후 수집된 데이터를 바탕으로 성과를 측정해 실제 사용 환경에서도 결과가 재현되는지 확인하는 데에는 별다른 의욕을 보이지 않는다고 본다. 그는 “빅테크 기업들은 모델을 만들고 [실험실에서] 시험하고 검증하는 데는 능숙하다”며 “하지만 대체로 … 우리가 보고 싶어 하는 종류의 [실제 현장] 시험에 대한 열정이나 재정적 뒷받침을 실제로 보여주지는 않았다”고 말했다.

투명성 부족

임상의이자 연구자인 앤드류 웡(Andrew Wong)은 미시간 대학교(University of Michigan) 재직 시절 결함이 있는 패혈증 도구의 성능을 조사했으며, 동료들과 함께 개발사와 협력해 이 도구의 성능을 개선하는 작업을 벌였다.

그는 기업들이 AI 도구가 업무 흐름을 어떻게 개선하고 재정적 절감을 창출하는지에 대해 극히 구체적인 주장을 하는 경우가 많지만, 그러한 이익을 검증하기 쉽게 해 줄 정보를 공개할 의무는 없다고 말한다.

여기에는 “모델이 어떻게 학습되었는지, 어떤 종류의 데이터셋이 사용되었는지, 개발에 어떤 방법론이 사용되었는지, 그리고 보고된 성능 통계치를 도출하기 위해 모델을 어디에서 검증했는지”가 포함될 수 있다.

현재 유타 대학교(University of Utah) 임상 AI 연구 디렉터로 재직 중인 웡은, 이런 투명성이 없으면 환자 인구 구성이나 병원 업무 방식 등의 요인에 따라 효과가 좌우될 수 있는 이런 도구들을 시험하는 일이 개별 기관의 몫으로 남게 된다고 말한다. 모든 기관이 이를 수행할 자원을 갖추고 있는 것은 아니다.

유트레흐트 대학 의료센터(University Medical Centre) 데이터 과학·생물통계학과 조교수인 콘스탄사 안다우르 나바로(Constanza Andaur Navarro)에 따르면, AI 도구의 혁신적 효과에 대한 과도한 과대 광고는 개발 과정에서 놀랄 만큼 이른 단계에서 시작될 수 있다. 그녀와 동료들은 새로운 AI 모델을 기술한 논문들을 분석했으며, 그녀가 ‘스핀(spin)’이라 부르는 경향이 매우 높다는 사실을 발견했다. 연구에 따르면, 특정 도구를 일상 진료에 사용해야 한다고 권고한 21개의 초록 가운데 20개는 “개발된 모델에 대한 외부 검증이 전혀 없었다”.

의료 분야 AI 규제에 대한 접근 방식은 전 세계마다 다르다. 하지만 드레스덴 대학교 의료기기 규제과학 교수 스티븐 길버트(Stephen Gilbert)에 따르면, 한 가지 측면에서는 서로 비슷하다. 즉 도구가 시장에 출시된 이후의 감시는 대개 '원시 데이터가 전혀 없는, 제조업체가 작성한 정제된 보고서'로 이루어지기 때문에 제3자가 쉽게 검증할 수 없다는 것이다.

스탠퍼드 대학교가 올해 발표한 보고서에 따르면, 미국 식품의약국(FDA)은 2025년에 258개의 AI 의료기기를 승인했으며 이 중 대부분은 새로운 임상시험을 요구하지 않았다. 승인된 기기 가운데 약물이 환자에게 닿기 전에 필수로 간주되는 종류의 시험 데이터로 뒷받침된 것은 2.4퍼센트에 불과했다.

일각에서는 이러한 연구들이 생성형 AI 시대에 맞춰 의료 제품의 안전성을 보장해 온 오랜 기존 방식을 재고해야 할 필요성을 강조한다고 본다.

무작위 대조 시험은 임상에서 사용되는 동안 변하지 않는 분자나 혈압계 커프 같은 기기를 평가하도록 설계되었다. 하지만 대규모 언어 모델을 구동하는 알고리즘은 끊임없이 변하고 있다고 예일대학교의 몰리(Morley)는 말한다.

일부 규제 기관은 더 높은 수준의 안전장치를 검토하면서도 새로운 기술을 막지 않도록 애쓰고 있다.

"지금까지보다 더 빠르고 더 널리 이러한 AI 도구를 임상의들의 손에 쥐여줘야 합니다. 의료를 개선할 잠재력은 . . . 정말, 정말 크니까요"라고 영국 의약품및의료제품규제청(MHRA)의 최고경영자 로렌스 탤런이 말했다.

MHRA의 의료 분야 AI 규제에 관한 국가위원회는 이번 달 새 도구가 안전성과 효과를 입증할 때까지 조건부 승인을 부여하고, 이미 사용 중인 도구에 대해서는 지속적인 모니터링을 실시하는 등의 대책을 제안했다.

상반신의 3D 자기공명영상(MRI) 스캔을 보여주는 삽화로, 내부 구조와 혈관이 강조되어 있음
3D MRI 스캔. AI 시스템을 활용하는 일부 임상의들은 규제가 아직 기술 역량의 발전 속도를 따라가지 못하고 있다고 경고한다 © Zoonar/Stanislav Rishnyak/Alamy

탈론은 위원회가 권고한 실제 환경 모니터링이 AI가 여러 분야에서 임상적 변화를 일으키고 있음을 보여주는 탄탄한 증거 체계를 구축하는 데 도움이 될 것이라고 주장한다. 다만 그 결론은 아직 공식적으로 채택되지 않았다.

그는 또한 머크와 모더나가 AI의 도움을 받아 개발한 암 백신의 최근 인상적인 결과를 들며, 이 기술이 "좀 더 진보된 분야들에서 암 및 희귀질환 환자들의 치료 결과를 정말로 획기적으로 개선할" 잠재력의 증거라고 강조했다.

비슷한 사고방식은 미국에서도 뚜렷이 나타난다. 드레스덴 대학의 규제 전문가 길버트는 FDA와 협력해 심혈관 질환, 당뇨병, 정신 질환 등 — 결국 거의 모든 미국인을 괴롭히게 될 만성 질환들 — 분야의 AI 모델이 실제 사용 환경에서 생성된 증거를 바탕으로 규제 승인을 받을 수 있는 방안을 살펴보는 파일럿 프로그램을 진행해 왔다.

그러나 일부 임상의들은 규제가 아직 AI 역량의 성장 속도를 따라가지 못하고 있다고 경고하는데, 이 속도는 의료 및 헬스케어 분야에서 전례 없는 수준이다.

NHS 고위 마취과 전문의이자 기업가인 존 폴 진스는 첨단 AI 시스템을 시험하는 비영리 연구기관인 모델 이벨류에이션 앤드 스렛 리서치(Model Evaluation and Threat Research)의 증거를 인용했다. 이 기관은 AI 시스템이 50퍼센트의 성공률로 도움 없이 스스로 완수할 수 있는 소프트웨어 작업의 길이를 측정했으며, 그 결과 2023년 이후 작업 길이가 약 넉 달마다 두 배로 늘어나고 있음을 발견했다.

"지금 작성되고 있는 어떤 규제든 그 시험대는, AI 능력이 세 번 두 배씩 향상된 뒤에도 여전히 대중을 위해 제 역할을 하는가입니다. 눈앞에 놓인 도구를 기준으로 작성하면, 발표되기도 전에 시대에 뒤떨어질 수 있지요"라고 그는 말한다.

또 하나의 우려는 병원과 기타 의료기관이 AI 도구를 평가할 자원과 전문성을 갖추고 있는지 여부다. 미네소타대학교 공중보건대학(University of Minnesota School of Public Health)의 페이지 농(Paige Nong)이 이끈 2024년 연구에 따르면, 조사 대상 병원 중 절반 조금 넘는 곳만이 자원 배분이나 환자 진료에 AI 도구를 사용하기 전에 잠재적 편향 여부를 평가한 것으로 나타났다.

가상 대장내시경을 위한 3D CT 스캔 영상으로, 대장과 주변 복부 구조를 상세히 보여줌
AI의 도움을 받아 시행된 대장내시경이 이 기술 없이 시행된 경우보다 훨씬 더 많은 용종을 발견하는 것으로 나타났습니다 © Scott Camazine/Alamy

"이미 상대적으로 인력이 부족한 작은 시골 병원은 그런 종류의 평가를 수행할 여력 자체가 없을 수 있습니다"라고 그녀는 말하며, 이는 AI의 거침없는 확산이 건강 불평등을 심화시킬 위험이 있다는 우려를 부추긴다.

캘리포니아 대학교 버클리의 의사이자 연구자인 지아드 오버마이어는 자신이 근무하는 병원에서 자원 배분에 사용되던 '위험 계층화(risk stratification)' AI 도구를 연구하던 중 이 문제를 접하게 되었다. 그는 이 도구가 과거 지출액을 미래 수요의 대리 지표로 삼았고, 그 결과 의료 서비스가 필요했지만 과거에 제대로 받지 못했던 사람들—예컨대 소수 인종이나 영어를 사용하지 않는 사람들—이 계속해서 소외되고 있음을 발견했다.

그는 전반적으로 수억 명의 환자가 자신의 치료에 지출되는 비용에 관한 결정을 이러한 도구의 영향을 받고 있다고 말한다.

"이런 기술들이 이미 채택되고 있는 규모는 실로 어마어마한데, 많은 사람들이 그 사실을 모르고 있다고 생각합니다."

파악하기 어려운 데이터

성과를 성공적으로 모니터링하는 데는 기술적 장애물이 있을 수 있다. 미국 식품의약국(FDA) 전 수석 부국장인 에이미 애버너시는 임상 현장에서 더 많은 근거를 수집하려면 전통적으로 구축이 어려운 것으로 입증된 유형의 인프라가 필요할 것이라고 말한다.

그녀는 아이러니한 점이 있다면서 "알고리즘과 AI가 ... 실제로 데이터를 정리하는 데 도움을 줘야 알고리즘은 물론 다른 의료 서비스 제공 개입도 훨씬 더 세분화된 수준에서 평가할 수 있다"고 말한다.

또한 기록이 의료 당국 간에 손쉽게 공유될 수 있도록 보장하고, 이 데이터를 처리하는 데 따르는 법적 책임을 제한하는 입법도 필요할 것이라고 그녀는 제안한다.

흰 가운을 입고 태블릿을 든 Kayla Secrest가 Frankel Cardiovascular Center의 병원 복도에 서 있다.
Secrest와 그녀의 동료들의 경험은 실험실 조건에서 설계된 AI 도구와 예측 불가능한 의료 최전선에서의 그 활용 사이의 간극을 보여준다 © Steve Koss/FT

환자 데이터는 대체로 병원 안에 고립돼 있고 프라이버시 보호를 위해 세심하게 보호되는 경향이 있다고 오버마이어는 주장한다. “규제 당국은 기업들에게 ‘자, 당신들이 이 알고리즘이 훌륭하다고 주장하니, 가서 알고리즘이 단 한 번도 본 적 없는 데이터셋에서 어떤 성능을 보이는지 보여달라’라고 말하기가 어렵습니다 … 그런 데이터를 찾기가 매우 어렵거든요”라고 그는 덧붙인다.

그는 이 문제를 우회해 보고자 Dandelion Health라는 회사를 공동 창업했다. 이 회사는 미국 전역의 병원들과 협력해 AI 개발자들이 자신들의 알고리즘을 시험하는 데 활용할 수 있는 “매우 다양하고 방대한” 데이터셋을 구축해왔다.

다른 연구자들도 AI 도구가 환자 건강에 미치는 영향을 입증할 수 있는 데이터를 생성하는 더 효과적인 방법을 다듬기 위해 학계에서 실험을 진행하고 있다.

듀크대학교에 소속된 새미 슈파니 엘 파시는 개발자들이 의료 도구의 성능에 관한 주장을 뒷받침해야 할 필요성이 점점 더 널리 인식되고 있다고 말한다. 그는 산업계와 학계의 연구자들과 함께 외과의사가 더 나은 결정을 내리도록 돕는 애플리케이션을 개발하고 있다.

“우리는 ‘이 도구가 작동하는가?’를 알아내려는 것이 아닙니다”라고 엘 파시는 말한다. “우리가 던지는 질문은 이렇습니다. 이 도구는 환자의 치료 결과에 어떤 영향을 미칠 것인가?”

그는 덧붙였다. "우리는 이론에 머무는 단계를 넘어 실제 임상적 효과를 창출하려고 노력하고 있습니다."

혁신을 풀어내 실제 현장의 이점으로

FT 라이브 행사 'AI의 미래' 홍보 배너로, 11월 4일(수)부터 11월 5일(목)까지 영국 및 온라인에서 개최됨
이전AI 전쟁의 시대가 도래했다
 ↑ Big Read 목록
다음이란 에너지 쇼크가 전 세계를 발목 잡는 다섯 가지 방식