Google은 이번 주 48시간 이내에 두 가지 중요한 Gemini 모델 업데이트를 조용히 출시했으며, 두 가지 모두 프로덕션 애플리케이션을 구축하는 개발자를 겨냥하고 있습니다. Google의 공식 블로그에 따르면, 8월 26일에 출시된 Gemini 3.5 Transcribe는 현재까지 회사의 가장 정확한 음성-텍스트 모델입니다. 8월 27일에 발표된 Gemini Omni 1.1 Flash는 최대 40초의 장면 확장 및 4K 업스케일링을 포함하여 생성 비디오에 전문가 수준의 제어 기능을 제공합니다. 두 모델 모두 Google AI Studio의 Gemini API와 Gemini Enterprise Agent Platform을 통해 사용할 수 있습니다.
Gemini 3.5 Transcribe: 음성을 텍스트로 자동 정리하는 기능 이 이야기에 대한 자세한 내용은 AI 뉴스를 참조하세요.
Google에 따르면 Gemini 3.5 Transcribe가 기존 음성 인식과 다른 점은 원본 오디오를 원본 스크립트가 아닌 세련된 형식의 텍스트로 직접 변환한다는 것입니다. 이 모델은 배경 소음, 복잡한 전문 용어 및 유창성 정리를 기본적으로 처리합니다. "ums" 및 "ahs"와 같은 필러 단어를 제거하고 "화요일에 만나요, 아니, 수요일에 만나요"와 같은 자체 수정을 해결하고 출력 형식을 자동으로 지정합니다.
Google이 인용한 벤치마크 수치는 주목할 만합니다. 인공 분석으로 측정한 대로 이 모델은 스트리밍 사용 사례의 경우 평균 단어 오류율(WER) 4.0%, 비스트리밍 오디오의 경우 2.6%를 달성합니다. 주요 언어에 대한 FLEURS 다국어 벤치마크에서는 스트리밍 모드에서 5.50% WER, 비스트리밍에서 5.04%의 WER을 기록하여 Google의 이전 전사 모델인 Chirp 3을 개선했습니다. 인공 분석으로 측정한 결과 최종 전사 시간은 Chirp 3에 비해 70% 향상되었습니다.
이 모델은 두 가지 워크플로에 대한 두 가지 변형으로 제공됩니다. 라이브 애플리케이션의 경우 `gemini-3.5-transcribe-live`는 음성 에이전트 및 실시간 캡션을 대상으로 Live API를 통해 1초 미만의 대기 시간으로 지속적인 양방향 스트리밍을 제공합니다. 녹음된 오디오(회의, 통화 기록, 아카이브)의 경우 'gemini-3.5-transcribe'는 Interactions API를 통해 최대 3명의 화자(실험 모드에서 더 많은 지원 포함)에 대한 화자 속성과 단어 수준 타임스탬프를 제공합니다.
다른 기능으로는 악센트 및 방언 처리 기능을 갖춘 85개 이상의 언어에 대한 자동 감지 및 전사, 모델이 특수 전문 용어 및 고유한 철자법에 적응할 수 있도록 사용자 정의 어휘 지원이 있습니다. Google은 또한 모델에 일종의 눈을 제공했습니다. 함수 호출을 통해 이미지 생성이나 파일 분석과 같은 작업을 다른 Gemini 모델에 위임할 수 있습니다. 이 기능은 현재 macOS의 Gemini 앱에서 사용할 수 있습니다.
Gemini Omni 1.1 플래시: 비디오 생성으로 타임라인 확장
두 번째 출시는 AI 비디오에 대한 가장 일반적인 불만 사항인 제어를 해결합니다. Gemini Omni 1.1 Flash는 Google DeepMind 제품 관리자인 Anish Nangia와 Alisa Fortin이 이번 릴리스를 통해 Omni 1.1을 "전문적인 사용을 위한 프로덕션 준비"로 만들었다고 설명하면서 이전 버전과는 다른 방식으로 생성 비디오를 조종할 수 있게 만드는 프로덕션 중심 업데이트입니다.
장면 확장은 헤드라인 기능입니다. 이제 개발자는 모델이 최대 10초의 이전 컨텍스트를 분석하여 기존 클립에서 영상을 원활하게 생성할 수 있습니다. 이는 마지막 순간만 참조했던 이전 모델에서 도약한 것입니다. 비디오는 10초 단위로 최대 누적 길이 40초까지 확장할 수 있어 긴 스토리에 대한 시각적 일관성과 내러티브 일관성이 향상됩니다.
또한 이 업데이트에는 첫 번째 프레임과 마지막 프레임 보간 기능이 추가되어 개발자가 시작 및 끝 프레임을 지정하여 부드럽고 의도적인 카메라 움직임과 샷 간의 전환을 만들 수 있습니다. 전달을 위해 완성된 프로젝트를 4K 해상도로 업스케일할 수 있으며, 360p 미리보기 모드를 통해 제작자는 최종 렌더링에 착수하기 전에 프롬프트에 따라 빠르고 저렴하게 반복할 수 있습니다.
API에서 일상적인 표면까지
Google은 또한 두 모델을 소비자 제품에 연결하고 있는데, 이는 배포상의 이점이 나타나는 부분입니다. Android에서 Gboard의 새로운 "Rambler" 기능은 3.5 Transcribe를 사용하여 단어를 필터링하는 동시에 음성 생각을 올바른 형식의 텍스트로 변환합니다. 사용자는 음성으로 편집할 수도 있습니다. 이 모델은 또한 macOS의 Gemini 앱에서 받아쓰기를 지원하고 Google Antigravity의 화면 컨텍스트와 함께 작동하며 Chrome에 통합되고 있습니다.
개발자들에게 두 가지 출시는 하나의 전략으로 읽힙니다. Google은 대화하는 챗봇의 Gemini를 미디어를 보고 듣고 생산하는 인프라로 밀어넣고 있습니다. OpenAI, ElevenLabs 및 여러 비디오 스타트업이 동일한 영역에서 경쟁하는 가운데 2.6%의 단어 오류율과 40초의 일관된 장면은 음성 에이전트, 캡션 파이프라인, 크리에이티브 도구 등 실제로 수익을 창출하는 프로덕션 워크로드에 대한 Google의 첫 번째 입찰입니다. 개발자는 오늘부터 Google AI Studio에서 두 모델을 모두 사용하여 구축을 시작할 수 있습니다.
단어 오류율이 여전히 중요한 이유
단어 오류율은 학문적 통계처럼 들리지만, 프로덕션에서는 작동하는 음성 제품과 실망스러운 음성 제품의 차이입니다. 음성 에이전트의 모든 오해된 발언은 작업을 중단시킵니다. 잘못 듣는 주문 ID는 조회 실패를 유발하고, 왜곡된 주소는 패키지를 잘못된 도시로 보냅니다. 그렇기 때문에 스트리밍되지 않는 오디오의 2.6% WER과 한 세대 이전 모델에서 흔히 볼 수 있었던 높은 한 자릿수 비율 사이의 차이가 사용성 측면에서 엄청난 차이를 가져오는 것입니다.
Google이 보고한 두 가지 모드의 차이점은 건축가에게도 중요합니다. 스트리밍 전사(4.0% WER 수치)는 라이브 음성 에이전트와 같은 대화형 사용 사례에 필요한 1초 미만의 대기 시간에 대해 어느 정도 정확도를 교환합니다. 녹음된 오디오의 일괄 전사는 속도가 느리지만 2.6%에 도달하므로 통화 후 분석 및 보관 처리가 더 까다로울 수 있습니다. 하나의 조정 가능한 설정이 아닌 별도의 모델 엔드포인트로 두 가지를 모두 공개하기로 한 Google의 결정은 개발자가 이러한 절충안의 양쪽에서 서로 다른 제품을 구축한다는 점을 인정합니다.
비디오 제작을 위한 계층형 워크플로우
Omni 1.1 Flash 업데이트는 창의적인 작업이 실제로 어떻게 이루어지는지에 대해 똑같이 실용적입니다. 생성적 비디오는 반복하는 데 비용이 많이 들었습니다. 모든 즉각적인 실험은 전체 렌더링을 의미했습니다. 새로운 360p 미리보기 모드는 탐색과 전달을 분리하여 제작자가 프롬프트 변형을 저렴하게 순환할 수 있도록 하고 검토 후 남은 샷에 대한 4K 업스케일링 비용만 지불하면 됩니다.
장면 확장 메커니즘은 클립 크기의 빈민가에 AI 비디오를 보관하는 일관성 문제를 해결합니다. 최종 프레임만이 아닌 10초의 이전 컨텍스트를 분석함으로써 모델은 캐릭터, 조명 및 시각적 스타일을 일관되게 유지하면서 장면을 10초 단위로 최대 40초까지 확장할 수 있습니다. 편집자에게 결정적인 제어점을 제공하는 첫 번째 및 마지막 프레임 보간과 결합되어 기존 편집에서 작동하는 진입 및 진출 마커 — AI 생성 영상은 전체를 대체하는 것이 아니라 실제 후반 작업 파이프라인에 적합하기 시작합니다.
경쟁 상황
두 가지 출시 모두 Google을 목적지가 아닌 인프라로 자리매김했습니다. 연설에서 Google은 개발자가 이미 사용하고 있는 Gemini API에 최첨단 정확성을 결합하여 전문 전사 공급업체 및 클라우드 경쟁업체의 음성 스택을 인수하고 있습니다. 영상에서는 화려한 볼거리보다 제어와 워크플로우 통합을 강조하여 자금력이 풍부한 스타트업이 즐비한 시장에서 경쟁하고 있습니다.
유통상의 이점이 결정적인 요인이 될 수 있습니다. 개발자가 Gemini API에서 호출할 수 있는 동일한 전사 모델은 이미 Android의 Gboard Rambler 받아쓰기, macOS의 Gemini 앱, Google Antigravity 및 Chrome을 지원합니다. 즉, Google은 수십억 명의 사용자 상호 작용에서 모델 개발을 상환하는 동시에 모델 개발을 지속적으로 개선하는 다양한 실제 오디오를 수집할 수 있습니다. 2026년에 연설 또는 비디오 스택을 선택하는 개발자의 경우 해당 플라이휠은 이제 피치의 일부입니다.
---
AI 최신 소식최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.
AI 뉴스 더 보기 →