Google ha lanciato Gemini 3.5 Transcribe, un nuovo modello di sintesi vocale creato per la trascrizione in tempo reale che riconosce automaticamente più di 85 lingue e perfeziona l'output lungo il percorso, eliminando le parole di riempimento e correggendo gli errori verbali senza che venga chiesto.

Il lancio posiziona lo stack vocale di Google come uno sfidante diretto nel mercato della trascrizione in rapida crescita, dove precisione e latenza determinano sempre più quali servizi gli sviluppatori adottano per chiamate, riunioni, sottotitoli e interfacce vocali. Per maggiori informazioni su questa storia, consulta la nostra aggiornamenti sull'intelligenza artificiale.

Cosa può fare il modello

Secondo l'annuncio di Google, la cui copertura è stata pubblicata da The Decoder, Gemini 3.5 Transcribe va ben oltre la conversione delle parole pronunciate in testo:

  • Rilevamento automatico della lingua in oltre 85 lingue, senza necessità di configurazione
  • Rimozione delle parole di riempimento, pulizia di "um", "uh" e disfluenze simili
  • Correzione dei lapsus verbali, producendo una prosa leggibile anziché un rumore letterale
  • Formattazione autonoma del testo, inclusa punteggiatura e struttura

L'azienda segnala un tasso di errore di parole del 4,0% per l'audio in streaming e del 2,6% per l'audio registrato, insieme a una riduzione della latenza di circa il 70% rispetto al suo predecessore, Chirp 3: un margine sostanziale negli scenari di sottotitoli live in cui il ritardo interrompe le conversazioni.

Due interfacce per due lavori

Gli sviluppatori ottengono l'accesso tramite due distinte interfacce di programmazione dell'applicazione:

API live — `gemini-3.5-transcribe-live`

Gestisce lo streaming in tempo reale con una latenza molto bassa, concentrandosi su sottotitoli in tempo reale, agenti vocali e assistenti interattivi dove il tempo di risposta è più importante.

API di interazione — `gemini-3.5-transcribe`

Elabora l'audio registrato e restituisce le trascrizioni con l'attribuzione del relatore e i timestamp: il flusso di lavoro tipico per riunioni, interviste, podcast e post-produzione multimediale.

Oltre alla trascrizione, il modello supporta la chiamata di funzioni, il che significa che può delegare attività di follow-up ad altri modelli della famiglia Gemini, ad esempio l'attivazione di una richiesta di generazione di immagini o di una ricerca sul web basata su qualcosa detto durante una sessione. Ciò trasforma un motore di trascrizione in un livello di interfaccia controllabile per applicazioni guidate dalla voce.

Già disponibile per i prodotti Google

Il modello è disponibile oggi per gli sviluppatori in Google AI Studio e sulla Gemini Enterprise Agent Platform. Google lo ha anche collegato alle superfici consumer: Gboard su Android lo utilizza tramite un componente interno chiamato Rambler per la dettatura, l'app Gemini su macOS lo applica all'input vocale e l'integrazione con Chrome è prevista a seguire.

Questa distribuzione è importante. Il riconoscimento vocale guadagna terreno su larga scala e incorporare il modello in tastiere, app desktop e browser lo mette quotidianamente di fronte a miliardi di interazioni di input, alimentando al contempo i cicli di valutazione necessari per mantenere i tassi di errore inferiori a seconda di accenti, dialetti e ambienti rumorosi.

La posta in gioco nell'intelligenza artificiale vocale è competitiva

La trascrizione è diventata silenziosamente un campo di battaglia competitivo sia tra i laboratori di frontiera che tra i fornitori specializzati. La comprensione vocale accurata e a bassa latenza è il biglietto d'ingresso per i prodotti agenti che agiscono su comandi vocali, informazioni sulle riunioni aziendali, funzionalità di accessibilità e automazione del servizio clienti multilingue.

Abbinando miglioramenti aggressivi della latenza con output autocorrettivi, Google scommette sul fatto che gli sviluppatori preferiscono trascrizioni che si leggono come testo modificato piuttosto che come acquisizione fonetica grezza, scambiando la rigorosa fedeltà letterale con l'usabilità. I team che necessitano di documenti esatti, come trascrittori legali o medici, potrebbero comunque volere modalità letterali; per tutti gli altri, la differenza pratica tra ascoltare qualcuno e capirlo continua a restringersi.

Con Gemini 3.5 Transcribe ora generalmente disponibile in AI Studio e negli strumenti aziendali, il primo test significativo saranno i parametri di adozione da parte degli sviluppatori di agenti vocali, un segmento di mercato in crescita abbastanza rapidamente che anche i guadagni incrementali di precisione si traducono in decisioni di cambiamento considerevoli.

Perché la latenza è il vero campo di battaglia

I tassi di errore occupano i titoli dei giornali, ma la latenza determina silenziosamente quali prodotti sono fattibili. Un motore di trascrizione che alimenta una sovrapposizione di sottotitoli in tempo reale deve tenere il passo con la conversazione, altrimenti gli spettatori si disimpegnano. Un agente vocale che sta negoziando una chiamata all'assistenza clienti non può fare una pausa imbarazzante mentre il suo livello vocale si aggiorna. La riduzione del ritardo del 70% segnalata da Google rispetto a Chirp 3 mira proprio a questo divario, riducendo la distanza tra chi parla e i sistemi a valle che agiscono su di essa.

Per le applicazioni agentiche questo si compone: ogni svolta di un dialogo parlato implica riconoscimento, ragionamento e risposta. Ridurre i millisecondi dalla fase di riconoscimento offre ai costruttori margine di manovra da spendere su modelli di ragionamento più capaci – e più lenti – senza violare i budget temporali della conversazione.

Il compromesso letterale

Una scelta progettuale merita un esame accurato. Per impostazione predefinita, Gemini 3.5 Transcribe cura l'output: le parole di riempimento svaniscono, gli errori vengono corretti e la formattazione viene applicata automaticamente. Per la maggior parte degli usi aziendali (minuti, sottotitoli, archivi ricercabili) questo è esattamente ciò che gli utenti desiderano.

Ma alcuni flussi di lavoro dipendono da registrazioni letterali. Le deposizioni legali, le revisioni di conformità e il fact-checking giornalistico a volte richiedono di sapere esattamente cosa è stato detto, esitazioni incluse. Le organizzazioni dei settori regolamentati vorranno chiarezza su quanto del livellamento sia facoltativo e configurabile prima di migrare le pipeline sensibili sul nuovo modello. La documentazione di Google e i parametri API stabiliranno in modo efficace la linea di demarcazione tra testo letterale e rifinitura per il settore.

Un'impronta multilingue come fossato

La copertura di oltre 85 lingue con rilevamento automatico non è solo una voce dell'elenco di controllo delle funzionalità. La portata multilingue concentra il valore nei mercati in cui i concorrenti storicamente restano indietro: gli accenti regionali, il cambio di codice tra le lingue a metà frase e le lingue con poche risorse puniscono tutti i modelli addestrati in modo ristretto su corpora con una forte presenza di inglese.

Per le aziende globali che gestiscono centri di supporto in decine di paesi, un unico modello che gestisce il rilevamento della lingua riduce in modo trasparente la complessità dell'integrazione: una pipeline invece di molte configurazioni per mercato. In combinazione con la distribuzione attraverso i miliardi di installazioni Android di Gboard, Google sta posizionando il multilinguismo di qualità trascritta come un'infrastruttura piuttosto che come una funzionalità premium.

Cosa guardare

Tre segnali mostreranno se Gemini 3.5 Transcribe cambierà la quota di mercato o semplicemente aumenterà le aspettative: migrazione degli sviluppatori nei benchmark di terze parti nei prossimi mesi; quanto velocemente i rivali corrispondono ai numeri di latenza piuttosto che alle dichiarazioni di accuratezza; e se gli hook di chiamata di funzione generano un'ondata di agenti voice-first costruiti nativamente su Gemini. Il lancio è ora attivo e i livelli di prezzo tramite AI Studio dovrebbero rendere la sperimentazione abbastanza economica da far sì che i costi di passaggio scendano quasi a zero.

---

Rimani Aggiornato sull'IA

Le ultime notizie, analisi e scoperte sull'intelligenza artificiale — tutto in un posto.

Leggi altre notizie sull'IA →