Google a livrat în liniște două actualizări semnificative de model Gemini în 48 de ore în această săptămână, iar ambele sunt destinate în mod direct dezvoltatorilor care creează aplicații de producție. Gemini 3.5 Transcribe, introdus pe 26 august, este cel mai precis model de vorbire în text al companiei de până acum, potrivit blogului oficial Google. Gemini Omni 1.1 Flash, anunțat pe 27 august, oferă controale de calitate profesională pentru videoclipurile generative, inclusiv extinderea scenei de până la 40 de secunde și upscaling 4K. Ambele modele sunt disponibile prin API-ul Gemini din Google AI Studio și platforma Gemini Enterprise Agent.
Gemini 3.5 Transcriere: vorbire în text care se curăță după sine For more context on this story, see our ongoing artificial intelligence updates.
Ceea ce distinge Gemini 3.5 Transcribe de recunoașterea convențională a vorbirii, spune Google, este că convertește sunetul brut direct în text șlefuit și formatat, mai degrabă decât o transcriere brută. Modelul gestionează zgomotul de fundal, jargonul complex și curățarea disfluenței în mod nativ - elimină cuvintele de completare precum „ums” și „ahs”, rezolvă auto-corecțiile precum „să ne întâlnim marți — nu, miercuri” și formatează automat rezultatul.
Cifrele de referință citate de Google sunt notabile. După cum este măsurat de Analiza artificială, modelul atinge o rată medie de eroare a cuvintelor (WER) de 4,0% pentru cazurile de utilizare în flux și 2,6% pentru audio non-streaming. Pe benchmark-ul multilingv FLEURS în limbile de top, acesta afișează un WER de 5,50% în modul de streaming și 5,04% non-streaming, îmbunătățind modelul anterior de transcriere al Google, Chirp 3. Timpul până la transcrierea finală se îmbunătățește cu 70% în comparație cu Chirp 3, din nou măsurat de Analiza artificială.
Modelul este livrat în două variante pentru două fluxuri de lucru. Pentru aplicațiile live, `gemini-3.5-transcribe-live` oferă streaming bidirecțional continuu, cu o latență de sub secunde prin API-ul Live, țintind agenți vocali și subtitrări în timp real. Pentru sunetul înregistrat — întâlniri, jurnalele de apeluri, arhive — `gemini-3.5-transcribe` oferă atribuirea vorbitorilor pentru până la trei vorbitori (cu suport pentru mai multe în modul experimental) și marcaje temporale la nivel de cuvânt prin API-ul Interacțiuni.
Alte capabilități includ detectarea și transcrierea automată în peste 85 de limbi cu accent și manipulare a dialectelor și suport personalizat pentru vocabular, astfel încât modelul să se adapteze la jargon specializat și ortografii unice. De asemenea, Google a oferit modelului ochi de genul: prin apelarea funcției, poate delega sarcini precum generarea de imagini sau analiza fișierelor altor modele Gemini - o funcție disponibilă în prezent în aplicația Gemini pe macOS.
Gemini Omni 1.1 Flash: generarea video crește o cronologie
A doua lansare abordează cea mai frecventă plângere despre videoclipul AI: controlul. Gemini Omni 1.1 Flash este o actualizare axată pe producție, care face ca videoclipurile generative să fie orientate în moduri în care nu erau predecesorii săi, managerii de produs Google DeepMind, Anish Nangia și Alisa Fortin, descriind lansarea ca făcând Omni 1.1 „pregătit pentru producție pentru utilizare profesională”.
Extensia scenei este caracteristica titlului. Dezvoltatorii pot continua acum să genereze imagini fără întreruperi dintr-un clip existent, modelul analizând până la 10 secunde din contextul anterior - un salt față de modelele anterioare care făceau referire doar la ultima secundă. Videoclipurile pot fi extinse în trepte de 10 secunde până la o durată cumulată de 40 de secunde, îmbunătățind consistența vizuală și aderarea narativă pentru poveștile mai lungi.
Actualizarea adaugă, de asemenea, interpolarea primului și ultimului cadru, permițând dezvoltatorilor să specifice cadrele de început și de sfârșit pentru a crea mișcări fine și deliberate ale camerei și tranziții între fotografii. Pentru livrare, proiectele finalizate pot fi mărite la rezoluție 4K, în timp ce un mod de previzualizare 360p le permite creatorilor să repete rapid și ieftin solicitările înainte de a se angaja la randările finale.
De la API la suprafețele de zi cu zi
De asemenea, Google conectează ambele modele în produsele sale de consum, de unde se arată avantajul său de distribuție. Pe Android, noua funcție „Rambler” din Gboard folosește 3.5 Transcribe pentru a transforma gândurile rostite în text bine formatat, în timp ce filtrează cuvintele de completare – utilizatorii pot chiar să facă editări vocale. Modelul activează și dictarea în aplicația Gemini pe macOS, funcționează alături de contextul ecranului în Google Antigravity și este integrat în Chrome.
Pentru dezvoltatori, cele două lansări se citesc ca o singură strategie: Google împinge Gemini de la un chatbot cu care vorbiți într-o infrastructură care vede, aude și produce media. Cu OpenAI, ElevenLabs și o cohortă de startup-uri video care concurează pe același teritoriu, rata de eroare a cuvintelor de 2,6% și scenele coerente de 40 de secunde sunt oferta de deschidere a Google pentru sarcinile de producție care generează efectiv venituri - agenți vocali, conducte de subtitrări și instrumente creative. Dezvoltatorii pot începe să construiască cu ambele modele în Google AI Studio astăzi.
De ce este încă importantă rata de eroare a cuvintelor
Rata de eroare a cuvintelor sună ca o statistică academică, dar în producție este diferența dintre un produs de voce care funcționează și unul care frustra. Fiecare enunț greșit înțeles dintr-un agent vocal întrerupe o sarcină: un ID de comandă auzit greșit declanșează o căutare eșuată, o adresă confuză trimite un pachet în orașul greșit. Acesta este motivul pentru care diferența dintre un WER de 2,6 la sută pentru sunetul non-streaming și ratele mari de o singură cifră care erau obișnuite cu o generație de modele în urmă se transformă într-o diferență de ordin de mărime în utilizare.
Distincția dintre cele două moduri raportate de Google contează și pentru arhitecți. Transcrierea în flux - cifra WER de 4,0 la sută - schimbă o anumită precizie cu o latență de sub secundă, pe care o necesită cazurile de utilizare interactive, cum ar fi agenții de voce live. Transcrierea în lot a sunetului înregistrat rulează mai lent, dar atinge 2,6%, motiv pentru care analiza post-apel și procesarea arhivelor își pot permite să fie mai solicitante. Decizia Google de a le expune pe ambele ca puncte finale de model separate, mai degrabă decât o singură setare ajustabilă, recunoaște faptul că dezvoltatorii construiesc produse diferite de ambele părți ale acestui compromis.
Un flux de lucru pe niveluri pentru producția video
Actualizarea Omni 1.1 Flash este la fel de pragmatică în ceea ce privește modul în care se întâmplă de fapt munca creativă. Repetiția video generativă a fost costisitoare: fiecare experiment prompt însemna o randare completă. Noul mod de previzualizare 360p separă explorarea de livrare, permițând creatorilor să parcurgă variațiile prompte ieftin și plătind doar pentru upscaling 4K pentru fotografiile care supraviețuiesc examinării.
Mecanica extensiei scenei abordează problema de coerență care a păstrat videoclipurile AI în ghetoul de dimensiunea unui clip. Analizând 10 secunde din contextul anterior în loc de doar cadrul final, modelul poate extinde o scenă în trepte de 10 secunde până la 40 de secunde, păstrând în același timp caracterele, iluminarea și stilul vizual consistent. Combinată cu interpolarea primului și ultimului cadru – care oferă editorilor puncte de control deterministe, modul de funcționare a markerilor de intrare și ieșire în editarea convențională – filmările generate de AI încep să se încadreze în conductele reale de post-producție, mai degrabă decât să le înlocuiască angro.
Imaginea competitivă
Ambele lansări poziționează Google mai degrabă ca infrastructură decât ca destinație. În vorbire, Google se confruntă cu furnizorii de transcripții specializați și stivele de voce ale rivalilor săi din cloud prin gruparea preciziei de ultimă generație în API-ul Gemini pe care dezvoltatorii săi îl folosesc deja. În video, concurează pe o piață aglomerată cu startup-uri bine finanțate, punând accent pe controlul și integrarea fluxului de lucru în detrimentul spectacolului brut.
Avantajul distribuției poate fi factorul decisiv. Același model de transcriere pe care dezvoltatorii îl pot apela din API-ul Gemini alimentează deja dictarea Rambler de la Gboard pe Android, aplicația Gemini pe macOS, Google Antigravity și Chrome - ceea ce înseamnă că Google poate amortiza dezvoltarea modelului în miliarde de interacțiuni ale utilizatorilor, colectând în același timp diversitatea audio din lumea reală care îl îmbunătățește în continuare. Pentru dezvoltatorii care aleg o stivă de vorbire sau video în 2026, acel volant face acum parte din pitch.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →