·Report·Lex·Big Read·아카이브비공개 아카이브
← 아카이브 목록
AI

빅테크, AI의 미래는 ‘말하는 AI’에 달렸다 본다

OpenAI와 Google, 차세대 AI 에이전트와 상호작용하는 주된 수단으로 음성 시스템에 대대적 투자

샌프란시스코의 Cristina Criddle2026년 8월 6일880 단어원문 ↗

샌프란시스코의 크리스티나 크리들

어제 게재

AI 기업들은 챗봇과의 대화가 더욱 자연스럽게 느껴지도록 앞다퉈 개발에 나서고 있다. 기계와 대화할 때의 사회적 어색함에도 불구하고, 사람들이 AI 에이전트와 상호작용하는 지배적인 방식이 타이핑에서 음성 대화로 바뀔 것이라는 전망에 베팅하는 셈이다.

최근 OpenAI와 Google은 AI의 음성 기능을 업데이트해, AI가 화면을 읽는 로봇처럼 말하기보다 지시와 맥락을 이해하는 동료처럼 들리도록 했다.

이들의 최신 제품은 소비자와 기업의 수요가 폭발적으로 증가하는 가운데 출시됐으며, 음성을 텍스트로 변환하고 텍스트로 답변을 생성한 뒤 이를 다시 읽어주던 초기 음성 비서와는 상당한 차이를 보인다.

기술 기업들은 앞으로 우리가 AI와 상호작용하는 주된 방식이 키보드가 아니라 음성을 통한 방식이 될 것이라고 보고 있다.

최신 모델들은 음성을 직접 처리하고 생성할 수 있어, 이전 제품들이 기계적으로 느껴지게 했던 지연, 어색한 억양, 맥락 누락을 줄이는 데 도움이 된다.

“사람들은 질문을 할 때 자신의 목소리를 사용하는 것을 좋아합니다 . . . 음성은 사람다운 주고받기식 대화에 그저 적합합니다. 물론 텍스트도 훌륭하지만, 타이핑은 상당히 번거롭죠.”라고 OpenAI에서 ChatGPT 음성 기능의 제품 총괄을 맡고 있는 Atty Eleti는 말했다.

AI 시스템이 질문에 답하는 데서 더 장시간 이어지는 작업을 수행하는 단계로 나아갈수록, 챗봇 창에 프롬프트를 입력하는 것보다 AI에게 말하는 편이 더 자연스럽게 느껴질 것이라는 것이 이들의 판단이다.

그러나 이러한 추진은 지연과 배경 소음부터 공공장소에서 기계에 말을 거는 데 따른 사회적 불편함에 이르기까지, 음성 기술의 오래된 마찰 요인도 다시 드러내고 있다.

AI 업계는 이러한 변화가 이미 사용자 행동을 바꾸고 있다고 말한다. 구글은 4월까지 1년간 실시간 음성 기능 사용량이 두 배로 늘었으며, 챗봇 대화는 텍스트 대화보다 평균 5배 더 길었다고 밝혔다. 오픈AI에서는 매주 1억5,000만 명이 넘는 사람들이 ChatGPT에서 음성 및 받아쓰기 기능을 사용한다.

마이크로소프트에서 책임 있는 AI 부문 최고제품책임자를 맡고 있는 세라 버드는 “음성이라는 매체는 작업을 지속적으로 수행하는 에이전트가 등장하면서 다시 크게 부상하기 시작했다. 음성으로 에이전트에 작업을 지시하는 것이 매우 자연스럽게 느껴지기 때문”이라고 말했다.

버드는 동료들이 회사의 코딩 플랫폼인 깃허브에서 작업하면서 휴대전화로 음성 명령을 내려 코드를 작성하는 모습을 자주 본다고 덧붙였다. 그는 “이 분야에서는 곧 새로운 세상이 열릴 것이라고 생각한다”고 말했다.

오픈AI는 음성 기술이 이전에는 “지능의 지연”으로 인해 발전이 가로막혔다고 밝혔다. 지난달 GPT-Live가 출시되기 전까지, 즉 2년 만에 첫 음성 모델이 출시되기 전까지 오픈AI의 음성 모델은 반응이 느리고 서로 다른 언어나 억양을 혼동한다는 비판을 받았다.

구글에서 음성 경험 부문을 이끄는 릴랜드 레치스는 “사람들은 이제 모델이 이해한다는 것을 알기 때문에 더 많이 말하기 시작했고, 더 많은 일을 할 수 있을 것이라고 기대하며 기기가 더 많은 일을 하기를 원하고 있다”고 말했다.

레키스는 대규모 언어 모델이 “마이크 뒤에 있다”는 사실을 알게 된 후 사용자들이 AI와 대화하는 데 더 편안함을 느끼게 되자, 구글이 “훨씬 더 즉흥적인 대화 스타일”을 선택했다고 덧붙였다.

초기 활용 사례 중 하나는 코딩이다. 지지자들은 음성을 사용하면 사용자가 입력한 프롬프트보다 자신의 의도와 제약 조건을 더 구체적으로 설명할 수 있다고 말한다.

OpenAI에서 국제 전략 및 운영 업무를 담당하는 산드로 지아넬라는 음성이 OpenAI의 코딩 도구 코덱스(Codex)를 사용하는 방식에서 중요한 부분이 됐다고 말했다.

그는 이달 링크드인에 “타이핑을 할 때는 문제를 너무 일찍 압축하고 곧바로 작업으로 넘어가는 경우가 많다. 말할 때는 왜 그런지 더 많이 설명하는 경향이 있다. 내가 실제로 이루려는 것이 무엇인지, 내 의도가 무엇인지, 어떤 제약 조건이 중요한지, 어떤 부분이 불확실한지, 좋은 결과가 어떤 모습일지 등을 설명한다”고 썼다.

음성 도구의 부상으로 실리콘밸리의 일부 스타트업은 시스템이 오디오와 배경 소음을 혼동하지 않도록 새로운 마이크와 사무실 방음 설비에 투자하고 있다. 여기에는 옷깃에 다는 핀 마이크부터 검은색 관과 마우스가드에 내장된 마이크까지 다양한 제품이 포함된다.

글로벌 음성 AI 스타트업의 벤처캐피털 활동을 보여주는 막대그래프: 음성 모델 투자가 급증했다

이러한 변화는 음성 입력을 덜 눈에 띄고 더 안정적으로 만들려는 Pocket과 Plaud 같은 하드웨어 스타트업에 새로운 경쟁 영역을 열어주고 있다. 이들 기업은 소형 휴대용 받아쓰기 기기 등을 선보이고 있다.

이 프로젝트를 잘 아는 여러 관계자에 따르면, OpenAI도 내년 초 자사 디바이스 제품군의 첫 제품을 출시할 것으로 예상된다. 이 제품은 카메라, 마이크, 스피커를 탑재한 주변 환경형 음성 비서가 될 예정이다.

AI 음성 스타트업은 투자자들의 관심도 더 많이 끌어모으고 있다. PitchBook 데이터에 따르면 올해 1분기 벤처캐피털 투자액은 70억 달러로, 지난해 같은 기간의 10억 달러에도 못 미친 수준에서 크게 늘었다.

뉴욕에 기반을 둔 스타트업 Sandbar는 말을 걸어 명령을 내리거나 메모를 녹음할 수 있는 반지를 설계했다. 이 반지는 사용자의 목소리에만 반응한다.

최고경영자(CEO)이자 공동 창업자인 Mina Fahmi는 기존 제품들이 사용하기 불편하다는 점을 깨달은 뒤 이 제품을 개발했다고 말했다. “AirPods에 대고 소리를 질러 음성 기능을 사용하려고 하니 주변 사람 모두에게 매우 불쾌했고, 개인적으로도 무척 당황스러웠습니다.”

AI 외계인 아바타를 선보이는 음성 스타트업 Tolan의 최고기술책임자 에번 골드슈미트는 이 기술이 여전히 배경 소음, 안정성, 그리고 사용자에게 적절한 감정적 어조와 맥락으로 응답하는 능력 측면에서 개선의 여지가 있다고 말했다.

그는 “우리는 훨씬 더 빠르게 발전 곡선을 오르고 있지만, 분명히 아직 해결해야 할 자잘한 문제들이 남아 있다”고 덧붙였다. “음성이 지배적인 상호작용 방식이 되는 것은 시간문제일 뿐이다.”

이 기사는 ChatGPT-Live가 7월 8일 출시됐다는 점을 반영해 수정됐습니다.

현실 세계에서 경쟁 우위를 창출하는 혁신의 실현

11월 4일 수요일~5일 목요일 영국 및 온라인에서 열리는 FT 라이브 행사 ‘Future of AI’ 홍보 배너
이전콜롬비아 마약조직원들, 드론 기술 배우러 우크라이나행
 ↑ 아카이브 목록
다음‘사람들이 나를 죽이려 할 것이다’: 아이티인들이 어떻게 도널드