Google a introdus două noi modele text-to-speech miercuri – Gemini 3.8 Flash TTS și Gemini 3.8 Flash-Lite TTS – numindu-le cele mai expresive modele de generație audio de până acum. Modelele sunt disponibile în Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook și Google Vids, conform anunțului Google din partea Leland Rechis, manager de produs al grupului, și Alan Cowen, director de cercetare științifică al echipei audio Gemini.
Lansarea mută generarea vocii dincolo de setările vocale statice în ceea ce Google descrie ca un studio creativ: voci concepute dintr-un mesaj text, performanțe direcționate linie cu linie și schele de siguranță încorporate de la început. Pentru mai multe despre aceasta și despre alte versiuni, consultați știrile modelului AI.
Două modele, două locuri de muncă
Perechea împarte volumul de muncă în mod familiar Google. Gemini 3.8 Flash TTS este creat pentru o direcție creativă profundă și un design de caractere - creând voci complet noi de la zero, prin mesaje în limbaj natural pentru jocuri, cărți audio captivante, podcasturi și medii interactive, cu control granular asupra indiciilor de acțiune, ritmului, schimbărilor de dialect și backchanneling. Gemini 3.8 Flash-Lite TTS este redarea cu volum: optimizat pentru dublare de volum mare, creare de conținut audio și agenți vocali expresivi la scară, cu control fin asupra tonului, ritmului și nuanțelor la costuri mai mici.
Poziționarea Google încadrează perechea ca transformând generarea vocii „din presetări statice într-un studio creativ dinamic”. Compania indică cărțile audio, jocurile și podcasturile ca destinații naturale pentru modelul emblematic, în timp ce varianta Lite vizează piața lipsită de farmec, dar enormă a agenților de dublare și de voce mereu activi, unde costul pe minut generat contează mai mult decât puterea stelelor. Ambele modele sunt integrate în produsele Google - Gemini Notebook și Google Vids printre ele - semnalând că tehnologia va apărea în instrumente destinate consumatorilor, mai degrabă decât să rămână doar un joc API.
Un studio vocal complet, de la 30 de voci la infinit
Google spune că dezvoltatorii pot scala acum de la 30 de voci originale la ceea ce numește o bibliotecă infinită. Sistemul de proiectare generativă a vocii le permite utilizatorilor să creeze voci personalizate prin specificarea rolului, accentului și caracteristicilor vocii în peste 100 de limbi și dialecte - demo-urile Google variază de la o voce de DJ plină de energie din Melbourne până la un „robot super-tinny, monoton” și un dragon japonez.
Pe lângă generație, modelele sunt livrate cu o bibliotecă de peste 2.000 de voci pregătite pentru producție, inclusiv varietăți regionale precum spaniola mexicană, franceză din Quebec și engleză scoțiană.
Replicarea vocii este inclusă cu balustrade: utilizatorii pot recrea un profil vocal consecvent dintr-o mostră audio de 30 de secunde - a propriei voci sau a uneia pe care au dreptul de a o folosi - susținută de verificarea consimțământului încorporată, filigran SynthID și acreditări C2PA. Google adaugă, de asemenea, funcționalități de salvare și scalare pentru a menține vocile personalizate consistente în cadrul proiectelor, cu remixarea vocii - reglarea fină a timbrului, înălțimea, ritmul și accentul prin solicitări - listată ca fiind în curând.
Dirijarea spectacolului, rând cu rând
Ambele modele acceptă direcția precisă pe linie. Dezvoltatorii își pot scrie propriile indicații de scenă sau lasă modelul să conducă livrarea de la indicii naturale de scenariu - diferența dintre un agent calm de serviciu pentru clienți și o scenă de suspans șoptită. Exploziile vocale scriptate, cum ar fi
Două funcții vizează lucrul cu forme mai lungi și cu mai multe voci. Generarea de formă lungă menține calitatea vocii și ritmul de-a lungul orelor de sunet continuu, cu o deviere minimă a difuzorului - destinate podcas-urilor și cărților audio - în timp ce punerea în scenă a scenei native cu doi vorbitori direcționează conversațiile în mai multe rânduri dintr-un singur scenariu, cu ture naturale și voci clar separate.
Benchmarks: nr. 1 pe Hume AI
Google conduce anunțul cu numere de la terți. Gemini 3.8 Flash TTS a ocupat locul 1 în clasamentul de referință al designului vocal al Hume AI cu un scor de 71,4 și conduce în modelarea accentului la 60,8. Pe indicele de calitate generală al Hume AI, cele două modele noi revendică locurile #1 și, respectiv, #2.
Afirmațiile de referință ale vânzătorului ar trebui să fie întotdeauna citite cu o oarecare prudență, dar Hume AI – o companie independentă de cercetare AI vocală – este un arbitru rezonabil pentru calitatea vorbirii, iar scorurile oferă Google un punct de discuție concret împotriva rivalilor în generarea vocii.
Cursa înarmărilor audio continuă
Noile modele se alătură unei familii audio Gemini în creștere rapidă, care include deja 3.5 Live Translate, 3.5 Transcribe, 3.8 Live și 3.8 Live Extended Thinking - modelele de voce în timp real lansate de Google la începutul acestei luni. Cadența nu este întâmplătoare: sinteza expresivă și fiabilă a vorbirii devine o infrastructură de bază pentru agenții vocali, asistența pentru clienți, instrumentele de accesibilitate și producția media, iar Google dorește ca Gemini să fie stratul implicit pentru toate acestea.
Pentru dezvoltatori, concluzia imediată este mai degrabă practică decât futuristă: vocile personalizate, dublarea multilingvă și narațiunea de ore de lungă sunt acum la o scurtă distanță în Gemini API și AI Studio - cu filigrane atașate.
Economia va decide cât de mult din acest potențial va fi folosit. Google nu a subliniat prețurile în materialele de lansare, dar existența unui nivel Flash-Lite implică o opțiune deliberată cu costuri reduse pentru sarcinile de lucru în vrac, oglindând strategia de nivelare pe care o aplică în familia de modele Gemini. Întreprinderile de pe Gemini Enterprise obțin aceleași capacități în spatele acordurilor lor existente, care este locul în care Google se așteaptă să aterizeze cea mai mare parte a producției audio de mare volum.
Ceea ce rămâne de văzut este cât de repede adoptă industriile creative narațiunea sintetizată. Filigranul și verificarea consimțământului reduc barierele legale și etice, iar cifrele de referință sugerează că calitatea nu mai este blocajul. Dacă afirmațiile Google se mențin în practică, diferența dintre o voce umană înregistrată și una generată este acum suficient de restrânsă încât costul și durata - nu autenticitatea - vor lua decizia pentru majoritatea proiectelor.
---
Rămâneți înaintea AIObțineți cele mai recente știri, analize și descoperiri despre AI - toate într-un singur loc.
Citiți mai multe știri AI →