·Report·Lex·Big Read·아카이브비공개 아카이브
← 아카이브 목록
비즈니스 교육

대학은 학생들에게 AI ‘평가’ 역량을 길러줘야 한다

조직에는 모델을 실제 필요와 끊임없이 대조해 검증할 수 있는 역량을 갖춘 인력이 필요할 것이다.

Andrew Hall2026년 7월 24일894 단어원문 ↗

필자는 스탠퍼드 경영대학원 정치경제학 교수다

오늘날 젊은이들은 소수의 AI 기업에 막대한 권력이 집중되는 모습을 지켜보고 있다. 이들 기업의 시스템은 그들의 경력과 정보, 기회를 좌우할 것이며, 일부 젊은이들은 자신들이 이 모든 일에 거의 발언권이 없다고 느끼는 것도 당연하다.

동시에 이 학생들을 교육하는 많은 대학은 이해할 만한 경계심으로 대응하며, 교실에서 AI 사용을 제한하거나 심지어 금지하고 있다. AI가 바꿔놓은 세상에 다음 세대를 대비시키려는 기관들이, AI를 어떻게 활용해야 하는지 가장 잘 이해해야 할 사람들로부터 이 기술을 차단하고 있는 셈이다.

더 나은 대응이 있다.

Microsoft 최고경영자(CEO) Satya Nadella는 최근 에세이에서 자신이 새로운 ‘루프’라고 부르는 것을 설명했다. 이는 조직이 자체 전문성과 AI를 결합한 뒤, AI 시스템이 해당 조직의 구체적인 목표에 얼마나 잘 부응하는지 정기적으로 평가하는 과정이다. 조직은 실제로 필요한 것을 기준으로 모델을 시험하고, 이를 거듭 최적화한 끝에, 기반 모델을 훈련한 기업이 아니라 조직 스스로 어디에 가치가 있으며 이를 어떻게 확보할 수 있는지 이해하는 위치에 이르게 된다.

기업들은 AI 도구 제공업체가 자신들의 데이터를 가져가고, 경쟁 우위를 복제하며, 자신들을 무용지물로 만들 수 있다는 위협을 깨닫고 있다. 이런 상황에서 이 루프는 기업에 새로운 형태의 주권을 제공한다. 검증 기준은 다음과 같다. 업무 흐름에서 한 모델을 다른 모델로, 가령 OpenAI의 ChatGPT를 Anthropic의 Claude로 교체하더라도 아무런 가치를 잃지 않는다면, 그 기업은 성공적으로 주권을 확보한 것이다.

Nadella는 기업에 대해 썼지만, 이 루프는 사실 AI 시대에 누구나 자신의 운명을 스스로 통제할 수 있는 방법에 관한 이론이다.

AI 교육 보고서 더 보기

AI 연구소들, 6조 달러 규모 교육시장에 진출하다; 대학들은 AI 통합 방식을 두고 어려운 선택에 직면하다; AI가 교실에서 비판적 사고를 없애고 있는가?

나는 스탠퍼드 경영대학원 강의실에서 AI를 가르치는 실험을 해왔고, AI가 두 가지 측면에서 가치가 있다는 사실을 발견했다. 첫째, 학생들이 기술에 직접 참여하면서 모델의 결과물을 체계적으로 검증하는 능력 같은 실질적인 역량을 키울 수 있게 해준다. 이는 숙고하지 않은 AI 결과물로 비판적 사고를 대체할 때 발생하는 역량 저하를 막아준다. 둘째, 학생들이 강력한 AI 모델에 대해 개인적으로 책임을 요구할 수 있는 위치에 서게 한다.

몇 주 전, 나는 코딩 경험이 전혀 없는 학부생들로 가득 찬 강의실에 들어가 내가 만든 ‘독재자 평가’를 보여줬다. 이는 각 주요 AI 모델이 독재자가 되려는 사람을 얼마나 쉽게 도와주는지 평가하기 위해 내가 개발한 일련의 프롬프트였다. 앤트로픽은 이제 이 ‘평가’를 자체 시스템 카드에 포함하고 있다. 시스템 카드는 다양한 조건에서 AI 모델이 어떻게 작동하는지, 개발자들이 파악한 위험은 무엇인지, 그리고 어떤 안전장치를 마련했는지를 요약한 위험관리 문서다.

나는 학생들에게 각자 관심 있는 주제를 골라 자신만의 평가를 만들어보라고 했다. 3시간 후, 모든 학생이 자신의 클로드 계정을 활용해 작동하는 평가를 완성했고, 각 모델이 자신들이 정한 기준에 따라 어떻게 성능을 발휘했는지를 보여주는 웹페이지까지 만들었다.

추천

정장을 입은 네 사람이 영란은행 밖 커다란 석조 기둥 근처에서 짝을 지어 앉아 이야기를 나누며 햇볕을 즐기고 있다.

그 결과물들은 학생들의 개인적인 열정을 아름다운 모자이크처럼 보여줬다. 브라질에서 성장한 한 학생은 모델이 다가오는 브라질 대통령 선거에 관한 사실 질문에 정확히 답하는지를 기준으로 모델들의 점수를 매겼다.

또 다른 학생은 사용자가 반박했을 때 모델이 입장을 고수하는지, 아니면 아첨하는 태도로 빠지는지를 측정했다. 또 다른 학생은 모델이 버마어보다 영어로 문화적으로 연관성 높은 질문에 더 잘 답하는지를 시험하는 순위표를 만들었다. 이 수업에서는 학생들이 개발한 24가지 기준에 따라 순위를 매겼으며, 논리 퍼즐부터 모델이 개인적인 문제를 다루는 방식까지 모든 것을 연구했다. 한 번의 수업에서 이렇게 많은 작업을 완수한다는 것은 불과 1년 전만 해도 상상하기 어려운 일이었다.

물론 학생들에게 평가를 만들라고 요청하는 것만으로 좋은 평가가 보장되지는 않는다. 연구소들이 의존하는 벤치마크조차 불안정한 것으로 드러났다. 오픈AI가 대규모 언어 모델이 소프트웨어 문제를 어떻게 해결하는지 평가하는 SWE-bench를 검토했을 때, 전문가들은 감사 대상 문제의 거의 60%에 기능적으로는 정답인 제출물을 거부하는 결함 있는 테스트 사례가 있다는 사실을 발견했다.

내 꿈은 이렇다. 어떤 학생도 자신의 삶을 형성할 AI 시스템에 대한 평가를 최소 한 번은 직접 구축해 보지 않고 대학을 떠나서는 안 된다.

그렇다고 AI가 모든 교실에 들어가야 한다는 뜻도 아니다. 우리 수업이 가능했던 것은 학생들이 이미 무언가를 알고 있었기 때문이다. 학생들이 관심을 갖고 있었고, 무엇을 측정해야 하는지 알 만큼 충분히 이해하고 있는 주제들이었다. 평가 체계에 담을 전문성이 없다면 평가 체계를 설계할 수 없다.

따라서 AI 사용이 금지되고 학생들이 예전 방식으로 비판적 사고를 기르는 수업도 여전히 필요하다. 그러나 학생들이 이러한 시스템을 지휘하고 비판적으로 평가하는 법을 배우는 수업도 반드시 있어야 한다. 그렇지 않으면 AI를 만들어내는 기업들이 전적으로 정한 조건에 따라 AI의 결과물을 수동적으로 소비하는 세대가 될 것이기 때문이다.

내 꿈은 이렇다. 어떤 학생도 자신의 삶을 좌우할 AI 시스템에 대한 평가 체계를 적어도 하나는 직접 구축해 보지 않고 대학을 졸업해서는 안 된다.

내년에는 학부생들과 함께 경영진과 MBA 학생들에게도 이 루프를 가르치기 시작할 계획이며, 이 실천이 스탠퍼드를 훨씬 넘어 확산되기를 바란다.

AI 시대의 분열은 이미 이러한 시스템을 측정하고 자신의 목적에 맞게 활용할 수 있는 사람들과, 그렇지 못한 사람들 사이에서 형성되고 있다.

1822년 켄터키의 학교를 세우던 한 정책 입안자에게 편지를 보내며, 제임스 매디슨은 스스로를 통치하려는 사람들은 “지식이 주는 힘으로 스스로 무장해야 한다”고 역설했다. 이 루프는 오늘날 사람들이 스스로를 무장하는 방법이며, 기술을 우리 손에 계속 쥐어 두는 방법이다.

일하는 법, 수요일

직장에서 앞서 나가는 데 필요한 모든 것을 매주 수요일 이메일로 받아보세요

이전AI가 교실에서 비판적 사고를 저해하고 있는가?
 ↑ 아카이브 목록
다음대학들, 정확성 우려에 AI 탐지 도구 사용 중단