Google은 자연스러운 음성 대화를 위한 가장 발전된 라이브 대화 모델인 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking을 출시했습니다. 이 모델은 9월 15일부터 Gemini API, Google AI Studio, Search Live, Gemini Live 및 Google Workspace 전반에 걸쳐 출시되기 시작했으며 Gemini Enterprise를 통해 비공개 미리 보기로 기업에 액세스할 수 있습니다.
이 발표는 Gemini Audio 팀을 대표하여 수석 엔지니어인 Tom Ouyang과 기술 직원인 Malini Jaganathan이 작성했습니다. 이는 이번 달 초 Flash 및 Flash Cyber 모델로 데뷔한 Gemini 3.8 제품군을 확장하며, OpenAI의 음성 모드와 음성 스타트업의 물결이 동일한 일상 사용 사례를 놓고 경쟁하는 시장인 실시간 다중 모드 음성 지원에 대한 Google의 가장 공격적인 추진을 의미합니다.
이번 출시는 Google의 모델 라인이 매우 혼잡한 상황에 적합합니다. 최신 AI 개발 보도에 따르면 이 회사는 가격, 코딩, 음성 부문에서 경쟁사와 싸우면서 이제 몇 주 동안 반복적으로 제품을 출시했습니다.
실시간 대화를 위해 제작됨
라이브 모델과 마이크가 부착된 표준 채팅 모델의 차이점은 대기 시간과 상태입니다. Google의 Live API 문서는 상태 저장 WebSocket 연결을 통해 오디오, 이미지 및 텍스트의 연속 스트림을 처리하고 원시 16kHz PCM 오디오, 초당 최대 1프레임의 JPEG 이미지 및 텍스트를 허용하고 음성 오디오를 실시간으로 반환하는 지연 시간이 짧은 인터페이스에 대해 설명합니다.
모델은 거의 실시간으로 시각적 입력을 처리하여 사용자가 보는 것을 비서가 볼 수 있도록 합니다. Google의 데모 비디오에서는 Gemini 3.8 Live가 시각적 맥락을 사용하여 직원 온보딩 세션을 안내하고, 거의 실시간으로 체스를 두며, 자연스러운 음성을 통해 완전한 사업 계획과 맞춤형 마케팅 툴킷을 구축하는 모습을 보여줍니다. 또한 이 모델은 사용자가 설정을 전환하지 않고도 대화 중에 지원되는 97개 언어를 자동으로 감지하고 전환할 수 있습니다.
아마도 실제 사용에서 가장 중요할 것입니다. 모델은 대화가 계속되는 동안 백그라운드에서 도구와 API 호출을 실행하고 작업이 완료되는 동안 요청을 승인하고 대화를 계속 진행합니다. 이는 순전히 턴제 응답자였던 보조자를 우연히 대화를 나누는 상담원에 더 가까운 것으로 바꿔줍니다.
Google이 홍보하는 수치
Google은 Gemini 3.8 Live Extended Thinking이 인공 분석의 음성 대 음성 품질 지수(Speech-to-Speech Quality Index)에서 82.6점으로 전체 1위를 차지했다고 보고했습니다. 에이전트 작업 완료 시 회사는 τ-Voice 벤치마크에서 68.6%, Sierra의 τ-Voice 뱅킹 평가에서 35.1%, Big Bench Audio에서 97.7% 점수를 받았습니다.
이는 Google이 자체적으로 보고한 수치이며 독립적인 검증에는 시간이 걸립니다. 그러나 인공 분석 차트의 상위권에 대한 주장이 유지된다면 Google은 전체 대화 품질에서 OpenAI 및 전용 음성 AI 회사의 음성 최적화 제품보다 앞서게 될 것입니다. Google은 또한 Extended Thinking이 3.8세대를 정의한 가격 압력에 대한 암묵적인 고개를 끄덕이는 매우 경쟁력 있는 가격대를 유지한다고 말합니다.
모델에서 생성된 모든 오디오에는 Google의 눈에 띄지 않는 워터마크인 SynthID가 표시되어 AI가 생성한 음성을 계속 감지할 수 있습니다. 이는 Google의 생성 제품 전체에서 표준이 되고 있는 규정 준수 및 잘못된 정보 보호 장치입니다.
사용할 수 있는 곳
가용성은 두 모델마다 다릅니다. Gemini 3.8 Live는 Google의 실시간 시각적 검색 모드인 Search Live의 모든 사용자가 사용할 수 있습니다. 확장된 사고는 Gemini Live, Google AI Pro 및 Ultra 구독자의 경우 Workspace를 통한 Docs, 모든 Google 사용자의 경우 Gmail 및 Keep에서 사용할 수 있습니다.
개발자는 Gemini API와 Google AI Studio를 통해 모델을 얻습니다. Google은 Live API가 이미 Agora, Fishjam, LiveKit, Pipecat, Vercel 및 Vision Agents를 포함한 플랫폼에서 사용되어 Google의 실시간 인프라 위에 음성 기반 인터페이스를 구축한다고 밝혔습니다. Salesforce, Genspark 및 Lumeris가 새 모델의 출시 파트너로 지정되었습니다.
혼잡한 음성 AI 시장
음성은 AI가 마침내 키보드를 벗어나는 곳이기 때문에 2026년 인터페이스 전쟁터가 되고 있습니다. 대화하는 동안 보고 듣고 언어를 전환하고 도구를 실행할 수 있는 모델은 다른 챗봇이 아닌 전화 통화, 고객 지원 라인 및 개인 비서와 경쟁하고 있습니다.
Google의 장점은 배포입니다. 검색, Android, Workspace 및 Chrome은 Live 모델에 경쟁업체와 비교할 수 없는 설치 기반을 제공합니다. 회사는 이제 최고의 음성 모델을 사용하여 사용자의 일상 구석구석에 존재하는 것이 단일 벤치마크 승리보다 더 중요할 것이라고 확신하고 있습니다. 라이벌들은 응답할 기회를 얻게 되지만, 구글은 한때 데모 기능이었던 음성이 이제는 일류 제품 라인이라는 점을 분명히 했습니다.
개발자에게 메시지는 마찬가지로 직접적입니다. 정확한 입력 형식을 게시하고, 백그라운드 도구 실행을 문서화하고, Live API 플랫폼으로 생태계를 시드함으로써 Google은 고객 지원 봇부터 웨어러블 보조자에 이르기까지 음성 인터페이스를 구축하는 모든 사람을 위한 기본 기반으로 스택을 만들려고 노력하고 있습니다. Gemini 3.8 Live의 품질 주장이 독립적인 테스트에서 유지되는지 여부에 관계없이 가용성 플레이는 이미 진행 중입니다.
---
AI보다 앞서 나가세요최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.
AI 뉴스 자세히 보기 →