OpenAI, 차세대 음성 모델 ‘GPT-Live’ 공개 · ChatGPT Voice 전면 개편
이미지 출처: Pixabay / 작가: StefanCoders
OpenAI가 사람과 인공지능 사이의 음성 대화를 더욱 자연스럽게 만들기 위한 차세대 음성 모델 제품군 ‘GPT-Live’를 공개했습니다.
OpenAI는 2026년 7월 8일 공식 발표를 통해 GPT-Live가 새롭게 개편된 ChatGPT Voice를 구동한다고 밝혔습니다. 유료 이용자에게는 GPT-Live-1이, 무료 이용자에게는 경량 모델인 GPT-Live-1 mini가 적용됩니다.
이번 업데이트는 음성을 문자로 바꾼 뒤 답변을 생성하는 기존의 단계적인 처리 방식에서 벗어나, 사용자의 말투와 속도, 멈춤, 끼어들기까지 실시간으로 이해하는 대화 경험을 제공하는 데 초점을 맞췄습니다.
듣기와 말하기를 동시에 처리하는 풀 듀플렉스 구조
GPT-Live의 핵심은 듣기와 말하기를 동시에 수행할 수 있는 풀 듀플렉스 구조입니다.
기존 음성 서비스는 사용자가 말을 완전히 마친 뒤 AI가 답변을 시작하는 방식이 일반적이었습니다. 이 때문에 사용자가 중간에 질문을 덧붙이거나 AI의 말을 끊으면 대화 흐름이 어색해질 수 있었습니다.
GPT-Live는 사용자가 말하는 도중에도 음성을 계속 듣고, 지금 답해야 하는지 아니면 더 기다려야 하는지를 판단합니다.
사용자가 생각을 정리하기 위해 잠시 멈추면 대화를 재촉하지 않고 기다리며, 답변 도중 새로운 질문을 하면 자연스럽게 말을 멈추고 사용자의 발언을 다시 듣습니다.
“음”, “네”, “알겠어요”와 같은 짧은 반응을 적절히 사용해 상대방의 말을 듣고 있다는 느낌을 전달하는 기능도 강화됐습니다.
말투와 속도까지 자연스럽게 조절
GPT-Live는 단순히 음성을 정확하게 인식하는 데 그치지 않고, 대화의 속도와 분위기에 맞춰 말하는 방식을 조절합니다.
사용자는 ChatGPT에 더 천천히 말하거나 짧고 간단하게 설명해 달라고 요청할 수 있습니다. 반대로 빠르게 핵심만 전달하도록 설정하는 것도 가능합니다.
OpenAI는 기존 ChatGPT Voice에서 제공하던 9개의 음성을 GPT-Live 환경에 맞춰 새롭게 조정했습니다.
이를 통해 언어 학습과 일상 대화, 이야기 듣기, 이동 중 핸즈프리 사용 등 다양한 상황에서 보다 자연스러운 음성 상호작용을 제공한다는 설명입니다.
복잡한 검색과 추론은 GPT-5.5에 맡겨
GPT-Live는 모든 작업을 음성 모델 하나가 직접 처리하는 구조는 아닙니다.
사용자의 질문에 웹 검색이나 복잡한 추론, 여러 단계의 도구 사용이 필요하면 GPT-Live가 해당 작업을 GPT-5.5와 같은 별도의 모델에 맡길 수 있습니다.
GPT-Live는 사용자와 음성 대화를 계속 이어가고, GPT-5.5는 백그라운드에서 검색과 분석을 처리하는 방식입니다.
예를 들어 사용자가 여행 계획이나 복잡한 기술 정보를 질문하면 GPT-Live는 대화를 유지하면서 다른 모델에 자료 조사와 추론을 요청할 수 있습니다.
OpenAI는 이러한 구조를 통해 빠르고 자연스러운 음성 대화와 고성능 추론 기능을 분리하면서도 하나의 서비스처럼 연결했다고 설명했습니다.
GPT-Live-1의 즉시 응답 모드와 GPT-Live-1 mini는 백그라운드에서 GPT-5.5 Instant를 활용합니다. 더 깊은 추론이 필요한 Medium과 High 모드는 각각 중간·높은 추론 강도의 GPT-5.5 Thinking을 사용합니다.
음성 대화 중 시각 자료도 제공
새로운 ChatGPT Voice는 음성 답변만 제공하는 인터페이스에서 벗어나 시각적 결과도 함께 표시합니다.
대화 내용에 따라 사진과 지도, 검색 결과, 텍스트 자료 등을 화면에 보여줄 수 있어 사용자는 음성으로 질문하면서 필요한 정보를 눈으로도 확인할 수 있습니다.
이는 음성 모드와 일반 채팅 화면을 별개의 기능으로 운영하기보다, 말하기와 보기, 검색을 하나의 대화 환경으로 결합하려는 변화입니다.
기존 고급 음성 모드보다 자연스러운 대화 강조
OpenAI는 GPT-Live-1과 GPT-Live-1 mini를 기존 Advanced Voice Mode와 비교하는 새로운 인간 평가를 실시했습니다.
평가에서는 5분에서 10분 동안 이어지는 대화를 기준으로 말차례 전환과 끼어들기 처리, 대화 흐름, 전반적인 자연스러움 등을 비교했습니다.
OpenAI에 따르면 참가자들은 동일한 조건의 대화에서 GPT-Live 제품군을 기존 Advanced Voice Mode보다 선호했습니다.
과학 추론 능력을 평가하는 GPQA와 웹에서 찾기 어려운 정보를 조사하는 BrowseComp, 통신 고객 지원을 가정한 음성 에이전트 평가에서도 GPT-Live-1이 이전 음성 모드보다 높은 성능을 기록했다고 밝혔습니다.
다만 이러한 결과는 OpenAI가 자체적으로 구성하거나 조정한 평가를 포함하고 있어, 모든 언어와 실제 사용 환경에서 동일한 차이를 보장하는 것은 아닙니다.
매주 1억5천만 명 이상 ChatGPT 음성 기능 사용
OpenAI에 따르면 매주 1억5천만 명 이상이 ChatGPT의 Voice와 받아쓰기 기능을 이용하고 있습니다.
주요 활용 사례는 일상적인 질문과 외국어 회화 연습, 어린이를 위한 이야기 생성, 출퇴근 중 대화, 화면을 사용하기 어려운 상황에서의 핸즈프리 작업 등입니다.
GPT-Live 도입은 음성 AI 경쟁의 중심이 단순한 음성 인식 정확도에서 실제 사람과 비슷한 대화 흐름과 끼어들기 처리, 실시간 추론 연결 능력으로 이동하고 있음을 보여줍니다.
앞으로 음성 인터페이스는 사용자가 명령을 내리고 결과를 듣는 단방향 도구를 넘어, 대화를 이어가면서 검색과 분석, 시각 자료 제공까지 함께 수행하는 복합적인 AI 인터페이스로 확장될 것으로 보입니다.
댓글 (0)
비밀번호 확인
댓글 삭제를 위해 비밀번호를 입력해주세요.