Google a lansat Gemini 3.5 Transcribe, un nou model de vorbire în text creat pentru transcrierea în timp real, care recunoaște automat peste 85 de limbi și șlefuiește rezultatele pe parcurs, eliminând cuvintele de completare și corectând poticnirile verbale fără a fi întrebat.

Lansarea poziționează stiva de vorbire a Google ca o provocare directă pe piața transcripțiilor în creștere rapidă, unde acuratețea și latența decid din ce în ce mai mult ce servicii adoptă dezvoltatorii pentru apeluri, întâlniri, subtitrări și interfețe vocale. For more context on this story, see our ongoing artificial intelligence updates.

Ce poate face modelul

Potrivit anunțului Google, a cărui acoperire a fost publicată de The Decoder, Gemini 3.5 Transcribe depășește cu mult convertirea cuvintelor rostite în text:

  • Detecție automată a limbii în peste 85 de limbi, fără configurare necesară
  • Eliminarea cuvintelor de completare, curățarea „um”, „uh” și alte disfluențe similare
  • Corectarea alunecărilor, producând proză lizibilă mai degrabă decât zgomot textual
  • Formatare autonomă a textului, inclusiv punctuația și structura

Compania raportează o rata de eroare a cuvintelor de 4,0% pentru streaming audio și 2,6% pentru audio înregistrat, alături de reduceri de latență de aproximativ 70% în comparație cu predecesorul său, Chirp 3 - o marjă substanțială în scenariile de subtitrări live în care întârzierea întrerupe conversațiile.

Două interfețe pentru două locuri de muncă

Dezvoltatorii au acces prin două interfețe distincte de programare a aplicațiilor:

Live API — `gemini-3.5-transcribe-live`

Se ocupă de streaming în timp real cu o latență foarte scăzută, vizând subtitrările live, agenții vocali și asistenții interactivi acolo unde timpul de răspuns contează cel mai mult.

Interactions API — `gemini-3.5-transcribe`

Procesează sunetul înregistrat și returnează transcrierile cu atribuirea vorbitorului și marcajele de timp - fluxul de lucru tipic pentru întâlniri, interviuri, podcasturi și post-producție media.

Dincolo de transcriere, modelul acceptă apelarea funcției, ceea ce înseamnă că poate delega sarcini ulterioare altor modele din familia Gemini - de exemplu, declanșând o solicitare de generare de imagini sau o căutare pe web pe baza a ceva spus în timpul unei sesiuni. Acest lucru transformă un motor de transcriere într-un strat de interfață controlabil pentru aplicații bazate pe voce.

Se livrează deja prin produsele Google

Modelul este live în Google AI Studio și pe Gemini Enterprise Agent Platform pentru dezvoltatori de astăzi. Google l-a conectat și la suprafețele consumatorilor: Gboard pe Android îl folosește printr-o componentă internă numită Rambler pentru dictare, aplicația Gemini pe macOS o aplică la intrarea vocală, iar integrarea Chrome este programată să urmeze.

Distribuția asta contează. Recunoașterea vorbirii își câștigă păstrarea la scară, iar încorporarea modelului în tastaturi, aplicații desktop și browsere îl pune în fața miliardelor de interacțiuni de intrare zilnic - în timp ce alimentează buclele de evaluare necesare pentru a menține ratele de eroare să scadă în accente, dialecte și medii zgomotoase.

Mize competitive în Speech AI

Transcrierea a devenit în liniște un câmp de luptă competitiv printre laboratoarele de frontieră și furnizorii specialiști deopotrivă. Înțelegerea corectă, cu latență redusă a vorbirii este biletul de intrare pentru produsele agentice care acționează pe comenzile vorbite, inteligența pentru întâlniri de companie, funcțiile de accesibilitate și automatizarea multilingvă a serviciilor pentru clienți.

Prin împerecherea îmbunătățirilor agresive ale latenței cu ieșirea cu auto-corecție, Google pariază că dezvoltatorii preferă transcrierile care citesc ca text editat, mai degrabă decât captură fonetică brută - schimbând fidelitatea textului strict pentru utilizare. Echipele care au nevoie de înregistrări exacte, cum ar fi transcriptoare legale sau medicale, ar putea să-și dorească în continuare moduri literale; pentru toți ceilalți, diferența practică dintre a auzi pe cineva și a-l înțelege continuă să se restrângă.

Cu Gemini 3.5 Transcribe acum disponibil în general în AI Studio și în instrumentele de întreprindere, primul test semnificativ va fi măsurătorile de adoptare de la dezvoltatorii de agenți vocali – un segment de piață care crește suficient de rapid încât chiar și câștigurile incrementale ale preciziei se traduc în decizii de schimbare considerabile.

De ce latența este adevăratul câmp de luptă

Ratele de eroare fac titluri, dar latența determină în liniște care produse sunt viabile. Un motor de transcriere care alimentează o suprapunere de subtitrări live trebuie să țină pasul cu conversația, sau spectatorii se retrag. Un agent vocal care negociază un apel de asistență pentru clienți nu se poate întrerupe stânjenitor în timp ce stratul său de vorbire ajunge din urmă. Reducerea de 70% a întârzierii raportată de Google în comparație cu Chirp 3 vizează exact acest decalaj - scurtând distanța dintre un difuzor care termină o propoziție și sistemele din aval care acționează asupra acesteia.

Pentru aplicațiile agentice, acest lucru implică: fiecare rânduială a unui dialog vorbit implică recunoaștere, raționament și răspuns. Reducerea milisecundelor de la etapa de recunoaștere oferă constructorilor spațiu pentru a cheltui pe modele de raționament mai capabile – și mai lente – fără a încălca bugetele de sincronizare a conversației.

Verbatim Trade-Off

O alegere de design merită analizată. În mod implicit, Gemini 3.5 Transcribe gestionează rezultatul: cuvintele de completare dispar, poticnirile sunt corectate și formatarea este aplicată automat. Pentru majoritatea utilizărilor de afaceri - minute, subtitrări, arhive care pot fi căutate - asta este exact ceea ce doresc utilizatorii.

Dar anumite fluxuri de lucru depind de înregistrările textuale. Depozițiile legale, verificările conformității și verificarea jurnalistică a faptelor necesită uneori cunoașterea exactă a ceea ce s-a spus, inclusiv ezitările. Organizațiile din industriile reglementate vor dori claritate cu privire la cât de mult din netezire este opțională și configurabilă înainte de a migra conductele sensibile către noul model. Documentația Google și parametrii API vor stabili în mod eficient locul în care se află linia verbatim-versus-lustruită pentru industrie.

O amprentă multilingvă ca Moat

Acoperirea a peste 85 de limbi cu detectare automată nu este doar un element din lista de verificare a caracteristicilor. Acoperirea multilingvă concentrează valoarea pe piețele în care concurenții sunt în decalaj istoric: accente regionale, schimbarea codului între limbi la mijlocul propoziției și limbile cu resurse reduse, toate pedepsesc modelele antrenate strict pe corpuri grele în limba engleză.

Pentru întreprinderile globale care dețin centre de asistență în zeci de țări, un singur model care gestionează detectarea limbajului reduce în mod transparent complexitatea integrării - un canal în loc de multe configurații pe piață. În combinație cu distribuția prin miliardele de instalări Android ale Gboard, Google poziționează multilingvismul de calitate transcrisă mai degrabă ca infrastructură decât ca o capacitate premium.

Ce să urmărești

Trei semnale vor arăta dacă Gemini 3.5 Transcribe modifică cota de piață sau doar ridică așteptările: migrarea dezvoltatorilor în benchmark-uri terță parte în următoarele luni; cât de repede rivalii se potrivesc cu numerele de latență, mai degrabă decât cu pretențiile de acuratețe; și dacă cârligele de apelare a funcției dau naștere unui val de agenți de voce, construiți nativ pe Gemeni. Lansarea este live acum, iar nivelurile de prețuri prin AI Studio ar trebui să facă experimentarea suficient de ieftină încât costurile de schimbare să scadă aproape la nimic.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →