Google은 실시간 전사를 위해 구축된 새로운 음성-텍스트 모델인 Gemini 3.5 Transcribe를 출시했습니다. 이 모델은 85개 이상의 언어를 자동으로 인식하고, 그 과정에서 출력을 다듬고, 추가 단어를 제거하고, 묻지 않고도 말의 잘못된 부분을 수정합니다.
이번 출시로 Google의 음성 스택은 빠르게 성장하는 전사 시장에서 직접적인 도전자로 자리매김했습니다. 이 시장에서는 정확성과 대기 시간에 따라 개발자가 통화, 회의, 캡션 및 음성 인터페이스에 채택하는 서비스가 점점 더 결정됩니다. 이 이야기에 대한 자세한 내용은 AI 뉴스를 참조하세요.
모델이 할 수 있는 일
The Decoder가 보도한 Google의 발표에 따르면 Gemini 3.5 Transcribe는 음성을 텍스트로 변환하는 것 이상의 기능을 제공합니다.
- 구성이 필요 없는 85개 이상의 언어에 대한 자동 언어 감지
- 필러 단어 제거, "um", "uh" 및 유사한 불명확성 제거
- 실수 교정, 말 그대로의 소음이 아닌 읽기 쉬운 산문 생성
- 구두점 및 구조를 포함한 자동 텍스트 서식
이 회사는 스트리밍 오디오의 경우 4.0%, 녹음된 오디오의 경우 2.6%의 단어 오류율과 이전 버전인 Chirp 3에 비해 약 70%의 대기 시간 감소를 보고합니다. 이는 지연으로 인해 대화가 중단되는 라이브 캡션 시나리오에서 상당한 마진입니다.
두 가지 작업을 위한 두 가지 인터페이스
개발자는 두 가지 서로 다른 애플리케이션 프로그래밍 인터페이스를 통해 액세스할 수 있습니다.
라이브 API — `gemini-3.5-transcribe-live`
응답 시간이 가장 중요한 라이브 캡션, 음성 에이전트 및 대화형 도우미를 대상으로 매우 짧은 대기 시간으로 실시간 스트리밍을 처리합니다.상호 작용 API — `gemini-3.5-transcribe`
녹음된 오디오를 처리하고 화자 특성 및 타임스탬프가 포함된 대본을 반환합니다. 이는 회의, 인터뷰, 팟캐스트 및 미디어 포스트 프로덕션의 일반적인 워크플로우입니다.전사 외에도 이 모델은 함수 호출을 지원합니다. 즉, 후속 작업을 Gemini 제품군의 다른 모델에 위임할 수 있습니다. 예를 들어 세션 중에 말한 내용을 기반으로 이미지 생성 요청이나 웹 검색을 트리거하는 등의 작업을 수행할 수 있습니다. 이는 녹음 엔진을 음성 기반 애플리케이션을 위한 제어 가능한 인터페이스 레이어로 전환합니다.
이미 Google 제품 전반에 걸쳐 배송 중
이 모델은 현재 개발자를 위한 Google AI Studio와 Gemini Enterprise Agent Platform에 게시되어 있습니다. Google은 이를 소비자 표면에도 연결했습니다. Android의 Gboard는 받아쓰기를 위해 Rambler라는 내부 구성 요소를 통해 이를 사용하고, macOS의 Gemini 앱은 이를 음성 입력에 적용하며, Chrome 통합도 뒤따를 예정입니다.
그 분포가 중요합니다. 음성 인식은 규모를 유지하고 모델을 키보드, 데스크톱 앱 및 브라우저에 내장하면 매일 수십억 건의 입력 상호 작용 앞에 배치됩니다. 동시에 악센트, 방언 및 시끄러운 환경 전반에 걸쳐 오류율을 낮추는 데 필요한 평가 루프를 제공합니다.
음성 AI의 경쟁적 이해관계
전사는 선도적인 연구실과 전문 공급업체 모두 사이에서 조용히 경쟁의 전장이 되었습니다. 정확하고 지연 시간이 짧은 음성 이해는 음성 명령, 기업 회의 인텔리전스, 접근성 기능 및 다국어 고객 서비스 자동화에 따라 작동하는 에이전트 제품의 시작 티켓입니다.
공격적인 대기 시간 개선과 자체 수정 출력을 결합함으로써 Google은 개발자가 원시 음성 캡처보다는 편집된 텍스트처럼 읽는 성적표를 선호할 것이라고 확신합니다. 즉, 사용성을 위해 엄격한 축어적 충실도를 거래하는 것입니다. 법률 또는 의료 기록 담당자와 같이 정확한 기록이 필요한 팀에서는 여전히 축어 모드를 원할 수 있습니다. 다른 모든 사람들에게는 누군가의 말을 듣는 것과 이해하는 것 사이의 실질적인 차이가 계속해서 좁아지고 있습니다.
이제 AI Studio 및 엔터프라이즈 도구에서 일반적으로 사용할 수 있는 Gemini 3.5 Transcribe를 통해 의미 있는 첫 번째 테스트는 음성 에이전트 개발자의 채택 지표가 될 것입니다. 이 시장 부문은 점진적인 정확성 향상도 상당한 전환 결정으로 이어질 만큼 빠르게 성장하고 있습니다.
지연 시간이 진짜 전쟁터인 이유
오류율은 헤드라인을 장식하지만 대기 시간은 어떤 제품이 실행 가능한지를 조용히 결정합니다. 라이브 캡션 오버레이를 제공하는 전사 엔진은 대화 속도를 따라가야 합니다. 그렇지 않으면 시청자가 참여하지 않습니다. 고객 지원 통화를 협상하는 음성 에이전트는 음성 레이어가 따라잡는 동안 어색하게 일시 중지할 수 없습니다. Google은 Chirp 3에 비해 지연 시간이 70% 감소했다고 보고했습니다. 즉, 문장을 마무리하는 화자와 그에 따라 작동하는 다운스트림 시스템 사이의 거리를 단축하는 것입니다.
에이전트 응용 프로그램의 경우 이는 복합적입니다. 음성 대화의 모든 전환에는 인식, 추론 및 응답이 포함됩니다. 인식 단계에서 밀리초를 단축하면 빌더는 대화 타이밍 예산을 위반하지 않고 더 유능하고 느린 추론 모델에 투자할 수 있는 여유를 갖게 됩니다.
말 그대로의 절충안
한 가지 디자인 선택은 면밀히 조사할 가치가 있습니다. 기본적으로 Gemini 3.5 Transcribe는 출력을 큐레이트합니다. 즉, 필러 단어가 사라지고 잘못된 부분이 수정되며 서식이 자동으로 적용됩니다. 회의록, 캡션, 검색 가능한 아카이브 등 대부분의 비즈니스 용도에서 이것이 바로 사용자가 원하는 것입니다.
그러나 특정 워크플로는 축어적 기록에 따라 달라집니다. 법적 증언, 규정 준수 검토, 저널리즘 사실 확인을 위해서는 때때로 주저함을 포함하여 말한 내용을 정확하게 알아야 합니다. 규제 대상 산업의 조직은 민감한 파이프라인을 새 모델로 마이그레이션하기 전에 어느 정도의 평활화가 선택 사항이고 구성 가능한지 명확하게 알고 싶어합니다. Google의 문서와 API 매개변수는 업계에서 축어적 대 세련된 라인이 위치하는 위치를 효과적으로 설정합니다.
해자로서의 다국어 발자국
자동 감지 기능을 갖춘 85개 이상의 언어 지원은 단순한 기능 체크리스트 항목이 아닙니다. 다국어 도달 범위는 경쟁사가 역사적으로 뒤쳐져 있는 시장에 가치를 집중시킵니다. 즉, 지역적 억양, 문장 중간의 언어 간 코드 전환, 자원이 적은 언어는 모두 영어가 많은 말뭉치에서 좁게 훈련된 모델을 처벌합니다.
수십 개 국가에서 지원 센터를 운영하는 글로벌 기업의 경우 언어 감지를 처리하는 단일 모델을 사용하면 여러 시장별 구성이 아닌 하나의 파이프라인으로 통합 복잡성을 투명하게 줄일 수 있습니다. Gboard의 수십억 개의 Android 설치를 통한 배포와 결합하여 Google은 전사 품질의 다국어 지원을 프리미엄 기능이 아닌 인프라로 자리매김하고 있습니다.
볼만한 동영상
Gemini 3.5 Transcribe가 시장 점유율을 변화시키는지 아니면 단순히 기대치를 높이는지 여부를 보여주는 세 가지 신호가 있습니다. 향후 몇 달 동안 타사 벤치마크에서 개발자 마이그레이션; 경쟁업체가 정확성 주장보다는 지연 시간 수치를 얼마나 빨리 일치시키는지; 함수 호출 후크가 Gemini에 기본적으로 구축된 음성 우선 에이전트의 물결을 생성하는지 여부. 출시는 현재 진행 중이며 AI Studio를 통한 가격 책정 계층을 통해 전환 비용이 거의 0이 될 정도로 실험을 저렴하게 만들 수 있습니다.
---
AI 최신 소식최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.
AI 뉴스 더 보기 →