Mercoledì Google ha introdotto due nuovi modelli di sintesi vocale: Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS, definendoli i suoi modelli di generazione audio più espressivi fino ad ora. I modelli sono disponibili su Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook e Google Vids, secondo l'annuncio di Google di Leland Rechis, product manager del gruppo, e Alan Cowen, direttore della ricerca scientifica nel team audio di Gemini.
Il lancio sposta la generazione vocale oltre le preimpostazioni vocali statiche in quello che Google descrive come uno studio creativo: voci progettate a partire da un messaggio di testo, performance dirette riga per riga e impalcature di sicurezza integrate fin dall'inizio. Per ulteriori informazioni su questa e altre versioni, consulta le nostre notizie sul modello AI.
Due modelli, due lavori
La coppia divide il carico di lavoro nel modo familiare di Google. Gemini 3.8 Flash TTS è progettato per una direzione creativa e un design dei personaggi profondi, creando voci completamente nuove da zero tramite istruzioni in linguaggio naturale per giochi, audiolibri coinvolgenti, podcast e contenuti multimediali interattivi, con controllo granulare su spunti di recitazione, ritmo, cambiamenti dialettali e backchanneling. Gemini 3.8 Flash-Lite TTS è la riproduzione del volume: ottimizzata per il doppiaggio ad alto volume, la creazione di contenuti audio e agenti vocali espressivi su larga scala, con controllo capillare su tono, ritmo e sfumature a costi inferiori.
Il posizionamento di Google inquadra la coppia nel trasformare la generazione vocale "da preimpostazioni statiche in uno studio creativo dinamico". L'azienda punta ad audiolibri, giochi e podcast come destinazioni naturali per il modello di punta, mentre la variante Lite si rivolge al mercato poco affascinante ma enorme del doppiaggio e degli agenti vocali sempre attivi, dove il costo per minuto generato conta più del potere delle star. Entrambi i modelli sono integrati nei prodotti Google, tra cui Gemini Notebook e Google Vids, segnalando che la tecnologia emergerà negli strumenti rivolti al consumatore piuttosto che rimanere un gioco solo API.
Uno studio vocale completo, da 30 voci all'infinito
Google afferma che gli sviluppatori possono ora scalare da 30 voci originali a quella che chiama una libreria infinita. Il sistema di progettazione vocale generativa consente agli utenti di creare voci su misura specificando ruolo, accento e caratteristiche vocali in più di 100 lingue e dialetti: le demo di Google spaziano da una voce da DJ ad alta energia di Melbourne a un "robot super metallico e monotono" e un drago giapponese.
Oltre alla generazione, i modelli vengono forniti con una libreria di oltre 2.000 voci pronte per la produzione, comprese varietà regionali come lo spagnolo messicano, il francese del Quebec e l'inglese scozzese.
La replica vocale è inclusa con i guardrail: gli utenti possono ricreare un profilo vocale coerente da soli 30 secondi di campione audio - della propria voce o di uno di cui hanno i diritti di utilizzo - supportato dalla verifica del consenso integrata, dalla filigrana SynthID e dalle credenziali C2PA. Google sta inoltre aggiungendo funzionalità di salvataggio e scalabilità per mantenere le voci personalizzate coerenti tra i progetti, con il remix vocale – regolazione fine di timbro, intonazione, ritmo e accento tramite istruzioni – elencato come disponibile a breve.
Dirigere la performance, riga per riga
Entrambi i modelli supportano una direzione precisa per linea. Gli sviluppatori possono scrivere le proprie didascalie o lasciare che sia il modello a guidare la consegna in base a segnali di copione naturali: la differenza tra un calmo agente del servizio clienti e una scena di suspense sussurrata. Esplosioni vocali programmate come
Due funzionalità sono rivolte al lavoro in forma più lunga e a più voci. La generazione in formato lungo mantiene la qualità della voce e il ritmo per ore di audio continuo con una deriva minima degli oratori, destinata a podcast e audiolibri, mentre la messa in scena nativa della scena a due altoparlanti dirige le conversazioni a più turni da un unico copione con turni naturali e voci chiaramente separate.
Benchmark: n. 1 nell'intelligenza artificiale di Hume
Google guida l'annuncio con numeri di terze parti. Gemini 3.8 Flash TTS ha conquistato il primo posto assoluto nel Voice Design Benchmark di Hume AI con un punteggio di 71,4, ed è leader nella modellazione degli accenti con 60,8. Nell'indice di qualità generale di Hume AI, i due nuovi modelli occupano rispettivamente il primo e il secondo posto.
Le affermazioni sui benchmark del fornitore dovrebbero essere sempre lette con una certa cautela, ma Hume AI – una società indipendente di ricerca sull’intelligenza artificiale vocale – è un arbitro ragionevole per la qualità del parlato, e i punteggi danno a Google un punto di discussione concreto contro i rivali nella generazione vocale.
La corsa agli armamenti audio continua
I nuovi modelli si uniscono alla famiglia audio Gemini in rapida crescita che include già 3.5 Live Translate, 3.5 Transcribe, 3.8 Live e 3.8 Live Extended Thinking: i modelli vocali in tempo reale che Google ha lanciato all'inizio di questo mese. La cadenza non è casuale: una sintesi vocale espressiva e affidabile sta diventando un’infrastruttura fondamentale per gli agenti vocali, l’assistenza clienti, gli strumenti di accessibilità e la produzione multimediale, e Google vuole che Gemini sia il livello predefinito per tutto ciò.
Per gli sviluppatori, il risultato immediato è pratico piuttosto che futuristico: voci personalizzate, doppiaggio multilingue e narrazioni di ore sono ora a portata di mano all'interno dell'API Gemini e di AI Studio, con filigrane allegate.
L’economia deciderà quanto di quel potenziale verrà utilizzato. Google non ha enfatizzato i prezzi nei materiali di lancio, ma l'esistenza di un livello Flash-Lite implica un'opzione deliberatamente a basso costo per carichi di lavoro di massa, rispecchiando la strategia di livello applicata alla famiglia di modelli Gemini. Le aziende su Gemini Enterprise ottengono le stesse funzionalità dietro i loro accordi esistenti, che è dove Google si aspetta che arrivi la maggior parte della produzione audio ad alto volume.
Ciò che resta da vedere è la rapidità con cui le industrie creative adottano la narrazione sintetizzata. La filigrana e la verifica del consenso riducono le barriere legali ed etiche e i numeri di riferimento suggeriscono che la qualità non è più il collo di bottiglia. Se le affermazioni di Google reggono nella pratica, il divario tra una voce fuori campo umana registrata e quella generata è ora abbastanza ristretto da far sì che costi e tempi di realizzazione, non l'autenticità, prendano la decisione per la maggior parte dei progetti.
---
Stai al passo con l'intelligenza artificialeRicevi le ultime notizie, analisi e scoperte sull'intelligenza artificiale, tutto in un unico posto.
Leggi altre notizie sull'AI →