Google a lansat Gemini 3.8 Live și Gemini 3.8 Live Extended Thinking, o pereche de modele de dialog live pe care compania le descrie ca fiind cele mai avansate de până acum pentru conversații vocale naturale. Modelele au început să fie lansate pe 15 septembrie în API-ul Gemini, Google AI Studio, Search Live, Gemini Live și Google Workspace, cu acces de întreprindere în previzualizare privată prin Gemini Enterprise.

Anunțul a venit de la Tom Ouyang, un inginer principal, și Malini Jaganathan, un membru al personalului tehnic, scriind în numele echipei Gemini Audio. Acesta extinde familia Gemini 3.8 care a debutat la începutul acestei luni cu modelele Flash și Flash Cyber ​​și marchează cea mai agresivă impulsionare a Google până acum în asistența vocală multimodală în timp real - o piață în care modul de voce al OpenAI și un val de startup-uri de vorbire concurează pentru același caz de utilizare zilnică.

Lansarea se încadrează într-o zonă remarcabil de aglomerată pentru linia de modele Google; acoperirea cele mai recente evoluții AI arată că compania a livrat acum în mod repetat în decurs de câteva săptămâni, în timp ce se luptă cu rivalii în ceea ce privește prețurile, codificarea și acum voce.

Creat pentru conversații în timp real

Ceea ce distinge modelele Live de un model standard de chat cu un microfon atașat este latența și starea. Documentația Google Live API descrie o interfață cu latență scăzută care procesează fluxuri continue de audio, imagini și text printr-o conexiune WebSocket cu stare, acceptând audio PCM brut de 16 kHz, imagini JPEG cu până la un cadru pe secundă și text și returnând sunetul vorbit în timp real.

Modelele procesează intrarea vizuală aproape în timp real, permițând asistentului să vadă ceea ce vede utilizatorul — videoclipurile demonstrative de la Google arată Gemini 3.8 Live îndrumând o sesiune de îmbarcare a unui angajat folosind contextul vizual, jucând șah aproape în timp real și construind planuri de afaceri complete și seturi de instrumente de marketing personalizate prin vorbire naturală. De asemenea, modelele pot detecta și trece automat între 97 de limbi acceptate, la mijlocul conversației, fără ca utilizatorul să schimbe setările.

Poate cel mai semnificativ pentru utilizare practică: modelele execută instrumente și apeluri API în fundal în timp ce conversația continuă, acceptând cererile și menținând dialogul în timp ce sarcinile se termină. Asta transformă asistentul dintr-un respondent strict pe rând în ceva mai aproape de un agent care se întâmplă să vorbească.

Cifrele pe care Google le promovează

Google raportează că Gemini 3.8 Live Extended Thinking a ocupat prima poziție generală în Indicele de calitate Speech-to-Speech al Artificial Analysis, cu un scor de 82,6. La finalizarea sarcinilor agentice, compania citează 68,6% pe benchmark-ul τ-Voice și 35,1% pe evaluarea Sierra τ-Voice-banking, alături de un scor de 97,7% pe Big Bench Audio.

Acestea sunt cifrele raportate de Google, iar verificarea independentă va dura timp – dar pretenția de a ajunge în partea de sus a graficului Artificial Analysis, dacă se menține, ar pune Google înaintea ofertelor optimizate pentru vorbire de la OpenAI și a companiilor dedicate de IA vocală în ceea ce privește calitatea generală a conversației. Google mai spune că Extended Thinking menține un preț extrem de competitiv, un semn implicit de presiune asupra prețurilor care a definit generația 3.8.

Întregul sunet generat de modele este marcat cu SynthID, filigranul insesizabil al Google, astfel încât vorbirea generată de AI rămâne detectabilă - o protecție a conformității și a informațiilor greșite care devine standard în produsele generative Google.

Unde îl puteți folosi

Disponibilitatea diferă între cele două modele. Gemini 3.8 Live este disponibil pentru toată lumea din Search Live, modul de căutare vizuală în timp real al Google. Extended Thinking este disponibil în Gemini Live, în Docs pentru abonații Google AI Pro și Ultra prin Workspace și în Gmail și Keep pentru toți utilizatorii Google.

Dezvoltatorii obțin modelele prin Gemini API și Google AI Studio, iar Google spune că Live API este deja folosit de platforme precum Agora, Fishjam, LiveKit, Pipecat, Vercel și Vision Agents pentru a construi interfețe bazate pe voce pe infrastructura în timp real a Google. Salesforce, Genspark și Lumeris sunt numiți ca parteneri de lansare pentru noile modele.

O piață aglomerată de IA pentru voce

Vocea devine câmpul de luptă al interfeței din 2026, deoarece este locul în care AI scapă în sfârșit de tastatură. Un model care poate vedea, asculta, schimba limba și rula instrumente în timp ce vorbește nu concurează cu alți chatbot, ci cu apelul telefonic, linia de asistență pentru clienți și asistentul personal.

Avantajul Google este distribuția: Search, Android, Workspace și Chrome oferă modelelor Live o bază instalată pe care niciun rival nu poate egala. Compania pariază că a fi prezent în fiecare colț al zilei unui utilizator – acum cu cele mai bune modele de voce – va conta mai mult decât orice câștig de referință. Rivalii vor avea șansa să răspundă, dar Google a precizat că vocea, cândva o funcție demonstrativă, este acum o linie de produse de primă clasă.

Pentru dezvoltatori, mesajul este la fel de direct. Prin publicarea formatelor exacte de intrare, documentarea execuției instrumentelor de fundal și semănarea ecosistemului cu platformele Live API, Google încearcă să facă din stiva sa substratul implicit pentru oricine construiește interfețe vorbite - de la roboți de asistență pentru clienți până la asistenți purtabili. Indiferent dacă afirmațiile de calitate ale Gemini 3.8 Live rezistă în timpul testării independente, jocul de disponibilitate este deja în mișcare.

---

Rămâneți înaintea AI

Obțineți cele mai recente știri, analize și descoperiri despre AI - toate într-un singur loc.

Citește mai multe știri AI →