OpenAI는 동시에 듣고 말할 수 있는 ChatGPT용 새로운 음성 모델 시리즈인 GPT-Live를 출시하여 현재까지 대화 음성 경험에 대한 회사의 가장 중요한 점검을 완료했습니다. 이 릴리스는 OpenAI가 설명하는 전이중 아키텍처를 사용하여 사용자가 회사에서 말하는 실제 전화 통화처럼 느껴지는 방식으로 비서와 중단하고, 대화하고, 대화할 수 있도록 합니다.
이번 출시는 이번 주 OpenAI의 광범위한 GPT-5.6 모델 제품군 출시와 함께 이루어졌으며, 음성 인터페이스에 대한 AI 속보를 기계에 명령하는 것보다는 사람과 채팅하는 것과 같은 느낌으로 만들려는 추진력을 나타냅니다.
GPT-Live의 차별점
기존 음성 도우미는 반이중 모드로 작동합니다. 즉, 말한 다음 중지하면 시스템이 요청을 처리하고 응답합니다. 턴 테이킹은 엄격합니다. GPT-Live는 전이중 오디오 처리를 통해 이러한 패턴을 깨뜨립니다. 즉, 모델이 말하는 동안에도 사용자의 소리를 들을 수 있습니다. 이를 통해 자연스러운 중단, 문장 중간 수정 및 중복되는 대화가 가능합니다. 인간은 앞뒤로 왔다 갔다 하는 방식이지만 음성 AI는 역사적으로 어려움을 겪어 왔습니다.
Reuters에 따르면 GPT-Live 모델은 동시에 듣고 말합니다. 이는 오랫동안 음성 AI 분야의 목표였던 기능입니다. 이 접근 방식은 이전 버전의 ChatGPT 음성 모드를 정의했던 어색한 일시 중지와 강제적인 순서 전환을 제거합니다.주목할만한 기술적 세부 사항: GPT-Live에서 복잡한 질문이 발생하면 해당 질문을 백그라운드에서 GPT-5.5에 전달합니다. 음성 모델은 실시간으로 대화 흐름을 처리하는 반면, 더 큰 추론 모델은 뒤에서 더 어려운 작업을 수행한 다음 답변을 다시 제공합니다. OpenAI에 따르면 이러한 분업은 실시간 대화를 자연스럽게 만드는 응답성을 희생하지 않고도 응답 품질을 대폭 향상시킵니다.
가용성 및 가격
OpenAI는 두 가지 계층으로 새로운 음성 모델을 출시합니다.
- GPT-Live-1 — 이제 ChatGPT 유료 가입자(Plus, Pro 및 Team 요금제)에게 제공되는 전체 모델입니다.
- GPT-Live-1 mini — 무료 ChatGPT 계정에 사용할 수 있는 더 작고 가벼운 버전입니다.
OpenAI에 따르면 API 액세스가 곧 출시될 예정입니다. 이를 통해 개발자는 자신의 애플리케이션에 전이중 음성을 구축할 수 있습니다. 회사는 아직 API에 대한 자세한 가격을 공개하지 않았습니다.
또한 이번 출시로 웹 검색이 음성 대화에 직접 추가되었습니다. 검색 엔진 저널이 보고한 대로 GPT-Live는 실시간 검색을 ChatGPT 음성에 통합하므로 사용자는 모드를 전환하지 않고도 현재 사건이나 빠르게 변화하는 정보에 대해 질문하고 새로운 웹 결과에 기반한 답변을 얻을 수 있습니다.
경쟁이 치열한 음성 AI 시장
GPT-Live는 점점 더 혼잡해지는 음성 AI 환경에 진입합니다. Google은 Android와 Gemini Live 제품 전반에 걸쳐 Gemini 기반 음성 기능을 추진해 왔으며, Apple은 계속해서 대규모 언어 모델을 중심으로 Siri를 재작업하고 있습니다. OpenAI의 주요 라이벌인 Anthropic은 최근 음성보다는 에이전트 코딩 및 추론 모델에 중점을 두었습니다.
전이중 접근 방식은 보다 광범위한 산업이 향하고 있는 것으로 보입니다. 동시 듣기와 말하기를 허용함으로써 GPT-Live는 대기 시간을 줄이고 사용자가 음성 도우미에 대해 겪었던 가장 큰 불만 사항인 대기 시간을 제거합니다. 복잡한 쿼리를 위해 GPT-5.5로 핸드오프하는 것은 OpenAI가 음성을 간단한 인터페이스가 아니라 가장 유능한 모델의 정문으로 본다는 신호이기도 합니다.
중요한 이유
음성은 수년 동안 보조 명령 기반 인터페이스로 취급되어 왔습니다. 타이머 설정 및 날씨 확인에는 적합하지만 미묘한 대화에는 덜 유용합니다. GPT-Live의 주장에 따르면 병목 현상은 결코 모델의 지능이 아니라 인터페이스: 인간이 고립된 폭발로 말하도록 강요하는 것입니다.
전이중 대화가 대규모로 안정적으로 작동한다면 사람들이 전화, 자동차, 스마트 스피커, 그리고 궁극적으로 웨어러블 장치에서 AI와 상호 작용하는 방식이 바뀔 것입니다. 또한 상시 청취 장치의 동의 여부, 합성 음성의 현실성, 보다 자연스러운 대화로 인해 사용자가 AI의 답변을 과신하게 만드는지에 대한 친숙한 우려도 제기됩니다.
OpenAI는 기존 콘텐츠 정책 외에 GPT-Live에 대한 구체적인 안전 조치를 자세히 설명하지 않았지만, 검색 통합을 통해 모델은 이제 사용자가 뒤로 스크롤할 수 있는 텍스트보다 비판적으로 평가하기 더 어려울 수 있는 실시간 정보를 음성으로 가져올 수 있음을 의미합니다.
다음에 나올 내용
현재 GPT-Live는 ChatGPT 기능이 먼저이고 개발자 제품이 두 번째입니다. 실제 테스트는 타사 앱, 고객 서비스 플랫폼 및 하드웨어 제조업체가 자체 제품에 전이중 대화를 연결할 수 있는 API 액세스로 시작됩니다. 이는 또한 OpenAI가 저렴한 오픈 소스 음성 모델과 기능을 일치시키려는 경쟁사로부터 가격 압박에 직면하게 되는 시기이기도 합니다.
GPT-5.6의 공개 릴리스와 동시에 출시되는 것은 OpenAI가 음성과 추론을 동일한 전략의 두 부분으로 본다는 것을 의미합니다. 즉, 생각하는 강력한 모델과 동료처럼 대화할 수 있는 인터페이스가 결합된 것입니다.
AI보다 앞서 나가세요
모델 출시, 음성 AI 및 업계를 형성하는 모든 것에 대한 지속적인 보도를 보려면 AI Buzz Wire에서 최신 AI 개발을 팔로우하세요.
AI 뉴스 자세히 보기 →



