W środę Google wprowadził dwa nowe modele syntezatora mowy – Gemini 3.8 Flash TTS i Gemini 3.8 Flash-Lite TTS – nazywając je najbardziej wyrazistymi modelami do generowania dźwięku w historii. Jak wynika z oświadczenia Google, Lelanda Rechisa, menedżera produktu grupy i Alana Cowena, dyrektora ds. badań w zespole audio Gemini, modele są dostępne w Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook i Google Vids.
Premiera przenosi generowanie głosu poza statyczne ustawienia głosu do czegoś, co Google określa jako studio kreatywne: głosy projektowane na podstawie podpowiedzi tekstowych, występy kierowane linijka po linijce i rusztowanie zabezpieczające wbudowane od początku. Więcej informacji na temat tej i innych wersji znajdziesz w aktualnościach dotyczących modeli AI.
Dwie modelki, dwie prace
Para dzieli się pracą w sposób znany Google. Gemini 3.8 Flash TTS został stworzony z myślą o głębokim kierowaniu kreatywnym i projektowaniu postaci — umożliwia tworzenie od podstaw zupełnie nowych głosów za pomocą podpowiedzi w języku naturalnym do gier, wciągających audiobooków, podcastów i multimediów interaktywnych, ze szczegółową kontrolą nad wskazówkami aktorskimi, tempem, zmianami dialektów i kanałami zwrotnymi. Gemini 3.8 Flash-Lite TTS to odtwarzanie głośności: zoptymalizowane pod kątem dubbingu o dużej głośności, tworzenia treści audio i ekspresyjnych agentów głosowych na dużą skalę, z precyzyjną kontrolą tonu, tempa i niuansów przy niższych kosztach.
Pozycjonowanie Google określa tę parę jako przekształcającą generowanie głosu „ze statycznych ustawień wstępnych w dynamiczne studio kreatywne”. Firma wskazuje audiobooki, gry i podcasty jako naturalne kierunki dla flagowego modelu, natomiast wersja Lite celuje w niechlubny, ale ogromny rynek dubbingu i zawsze aktywnych agentów głosowych, gdzie koszt wygenerowanej minuty jest ważniejszy niż moc gwiazdy. Obydwa modele są zintegrowane z produktami Google – wśród nich Gemini Notebook i Google Vids – co sygnalizuje, że technologia pojawi się w narzędziach przeznaczonych dla konsumentów, a nie pozostanie wyłącznie grą wykorzystującą interfejs API.
Pełne studio wokalne, od 30 głosów do nieskończoności
Google twierdzi, że programiści mogą teraz skalować od 30 oryginalnych głosów do tak zwanej nieskończonej biblioteki. Generatywny system projektowania głosu pozwala użytkownikom tworzyć własne głosy poprzez określenie roli, akcentu i charakterystyki głosu w ponad 100 językach i dialektach. Prezentacje Google obejmują energiczny głos DJ-a z Melbourne, „supercienkiego, monotonnego robota” i japońskiego smoka.
Oprócz generacji, modele są dostarczane z biblioteką ponad 2000 gotowych do produkcji głosów, w tym odmian regionalnych, takich jak meksykański hiszpański, francuski z Quebecu i szkocki angielski.
Replikacja głosu jest dołączona do barier ochronnych: użytkownicy mogą odtworzyć spójny profil wokalny z zaledwie 30-sekundowej próbki dźwięku — własnego głosu lub głosu, do którego mają prawa używać — w oparciu o wbudowaną weryfikację zgody, znak wodny SynthID i poświadczenia C2PA. Google dodaje także funkcję zapisywania i skalowania, aby zachować spójność niestandardowych głosów w różnych projektach, a remiksowanie głosu – dostrajanie barwy, wysokości, tempa i akcentu za pomocą podpowiedzi – będzie dostępne wkrótce.
Reżyseria spektaklu, linijka po linijce
Obydwa modele obsługują precyzyjny kierunek według linii. Programiści mogą napisać własne wskazówki sceniczne lub pozwolić modelowi kierować realizacją na podstawie naturalnych wskazówek scenariusza — to różnica między spokojnym agentem obsługi klienta a sceną napięcia szeptaną. Skryptowane wybuchy wokalu, takie jak <śmiech>,
Dwie funkcje dotyczą dłuższych form i pracy wielogłosowej. Generowanie długich form utrzymuje jakość głosu i tempo przez wiele godzin ciągłego dźwięku przy minimalnym przesunięciu głośników – przeznaczone dla podcastów i audiobooków – podczas gdy natywna inscenizacja sceny z dwoma głośnikami kieruje wieloobrotowymi rozmowami z jednego scenariusza z naturalną zmianą kolejności i wyraźnie oddzielonymi głosami.
Testy porównawcze: nr 1 w Hume AI
Google prowadzi w ogłoszeniu, podając numery innych firm. Gemini 3.8 Flash TTS zajął pierwsze miejsce w ogólnym rankingu Hume AI Voice Design Benchmark z wynikiem 71,4 i prowadzi w modelowaniu akcentu z wynikiem 60,8. W ogólnym indeksie jakości Hume AI oba nowe modele zajmują odpowiednio pierwsze i drugie miejsce.
Oświadczenia dostawcy dotyczące testów porównawczych należy zawsze czytać z pewną ostrożnością, ale Hume AI — niezależna firma badawcza zajmująca się badaniem sztucznej inteligencji głosowej — jest rozsądnym źródłem oceny jakości mowy, a wyniki dają Google konkretny punkt odniesienia w porównaniu z rywalami w dziedzinie generowania głosu.
Wyścig zbrojeń audio trwa
Nowe modele dołączają do szybko rozwijającej się rodziny urządzeń audio Gemini, która obejmuje już modele 3.5 Live Translate, 3.5 Transcribe, 3.8 Live i 3.8 Live Extended Thinking — modele głosowe działające w czasie rzeczywistym, które Google wprowadził na początku tego miesiąca. Ta rytmia nie jest przypadkowa: ekspresyjna, niezawodna synteza mowy staje się podstawową infrastrukturą dla agentów głosowych, obsługi klienta, narzędzi ułatwień dostępu i produkcji multimediów, a Google chce, aby Gemini było dla tego wszystkiego domyślną warstwą.
Dla programistów natychmiastowa korzyść jest raczej praktyczna niż futurystyczna: głosy niestandardowej marki, wielojęzyczny dubbing i wielogodzinna narracja są teraz dostępne w interfejsie API Gemini i AI Studio — z dołączonymi znakami wodnymi.
O tym, ile z tego potencjału zostanie wykorzystane, zadecyduje ekonomia. Firma Google nie kładła nacisku na ceny materiałów premierowych, ale istnienie warstwy Flash-Lite sugeruje celową, tanią opcję w przypadku dużych obciążeń, odzwierciedlającą strategię warstwowania stosowaną w całej rodzinie modeli Gemini. Przedsiębiorstwa korzystające z Gemini Enterprise uzyskują te same możliwości w ramach istniejących umów. Google spodziewa się, że właśnie tam trafi większość wielkonakładowej produkcji audio.
Nie wiadomo jeszcze, jak szybko branże kreatywne przyjmą syntetyczną narrację. Znak wodny i weryfikacja zgody zmniejszają bariery prawne i etyczne, a liczby referencyjne sugerują, że jakość nie jest już wąskim gardłem. Jeśli twierdzenia Google sprawdzą się w praktyce, różnica między nagranym lektorem a wygenerowanym głosem jest obecnie na tyle mała, że w przypadku większości projektów ostateczną decyzję podejmie koszt i czas realizacji, a nie autentyczność.
---
Wyprzedź sztuczną inteligencjęOtrzymuj najnowsze wiadomości, analizy i przełomowe informacje dotyczące sztucznej inteligencji — wszystko w jednym miejscu.
Przeczytaj więcej aktualności o sztucznej inteligencji →