Firma Google wprowadziła na rynek Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking – dwa modele dialogów na żywo, które firma określa jako najbardziej zaawansowane w historii, umożliwiające naturalną rozmowę głosową. Wdrażanie modeli rozpoczęło się 15 września w interfejsach Gemini API, Google AI Studio, Search Live, Gemini Live i Google Workspace, z dostępem dla przedsiębiorstw w prywatnej wersji zapoznawczej za pośrednictwem Gemini Enterprise.
Ogłoszenie pochodzi od Toma Ouyanga, głównego inżyniera i Malini Jaganathana, członka personelu technicznego, którzy napisali w imieniu zespołu Gemini Audio. It extends the Gemini 3.8 family that debuted earlier this month with the Flash and Flash Cyber models, and it marks Google's most aggressive push yet into real-time, multimodal voice assistance — a market where OpenAI's voice mode and a wave of speech startups are competing for the same daily-use case.
Premiera wpisuje się w niezwykle zatłoczony odcinek linii modeli Google; coverage of the latest AI developments shows the company has now shipped repeatedly in the span of a few weeks as it fights rivals on pricing, coding and now voice.
Stworzony do rozmów w czasie rzeczywistym
To, co odróżnia modele Live od standardowego modelu czatu z dołączonym mikrofonem, to opóźnienie i stan. Google's Live API documentation describes a low-latency interface that processes continuous streams of audio, images and text over a stateful WebSocket connection, accepting raw 16kHz PCM audio, JPEG images at up to one frame per second, and text, and returning spoken audio in real time.
The models process visual input in near real time, letting the assistant see what the user sees — Google's demonstration videos show Gemini 3.8 Live guiding an employee onboarding session using visual context, playing chess in near real time, and building complete business plans and custom marketing toolkits through natural speech. Modele potrafią także automatycznie wykrywać 97 obsługiwanych języków i przełączać się między nimi w trakcie rozmowy, bez konieczności przełączania ustawień przez użytkownika.
Perhaps most significant for practical use: the models execute tools and API calls in the background while the conversation continues, acknowledging requests and keeping the dialogue going while tasks finish. To zmienia asystenta z respondenta ściśle turowego w osobę bliższą agentowi, który zdarza się mówić.
Liczby zachwalane przez Google
Google reports that Gemini 3.8 Live Extended Thinking captured the top overall position on Artificial Analysis' Speech-to-Speech Quality Index with a score of 82.6. On agentic task completion, the company cites 68.6% on the τ-Voice benchmark and 35.1% on Sierra's τ-Voice-banking evaluation, alongside a 97.7% score on Big Bench Audio.
Those are Google's own reported figures, and independent verification will take time — but the claim to the top of Artificial Analysis' chart, if it holds, would put Google ahead of the speech-optimized offerings from OpenAI and dedicated voice AI companies on overall conversation quality. Google also says Extended Thinking maintains a highly competitive price point, an implicit nod to the price pressure that has defined the 3.8 generation.
All audio generated by the models is watermarked with SynthID, Google's imperceptible watermark, so AI-generated speech remains detectable — a compliance and misinformation safeguard that is becoming standard across Google's generative products.
Gdzie możesz z niego skorzystać
Dostępność jest różna w przypadku obu modeli. Gemini 3.8 Live jest dostępny dla wszystkich korzystających z Search Live, wizualnego trybu wyszukiwania Google w czasie rzeczywistym. Funkcja Extended Thinking jest dostępna w Gemini Live, w Dokumentach dla subskrybentów Google AI Pro i Ultra w Workspace oraz w Gmailu i Keep dla wszystkich użytkowników Google.
Programiści uzyskują modele za pośrednictwem Gemini API i Google AI Studio, a Google twierdzi, że Live API jest już wykorzystywane przez platformy takie jak Agora, Fishjam, LiveKit, Pipecat, Vercel i Vision Agents do tworzenia interfejsów sterowanych głosem w oparciu o infrastrukturę czasu rzeczywistego Google. Salesforce, Genspark i Lumeris zostają partnerami wprowadzającymi na rynek nowe modele.
Zatłoczony rynek sztucznej inteligencji głosowej
Głos stanie się polem bitwy w interfejsie w 2026 r., ponieważ to właśnie tam sztuczna inteligencja w końcu wymyka się z klawiatury. A model that can see, listen, switch languages and run tools while talking is competing not with other chatbots but with the phone call, the customer support line and the personal assistant.
Przewagą Google jest dystrybucja: wyszukiwarka, Android, Workspace i Chrome zapewniają modelom Live bazę zainstalowaną, której nie może dorównać żaden rywal. Firma obstawia, że obecność w każdym miejscu dnia użytkownika — teraz dzięki najlepszym modelom głosu — będzie miała większe znaczenie niż jakiekolwiek zwycięstwo w pojedynczym benchmarku. Rywale będą mieli szansę odpowiedzieć, ale Google dał jasno do zrozumienia, że głos, będący niegdyś funkcją demonstracyjną, jest teraz linią produktów najwyższej klasy.
Dla programistów przesłanie jest podobnie bezpośrednie. Publikując dokładne formaty wejściowe, dokumentując działanie narzędzi działających w tle i zapełniając ekosystem platformami Live API, Google stara się uczynić swój stos domyślnym podłożem dla każdego, kto tworzy interfejsy mówione — od botów obsługi klienta po asystentów do noszenia. Niezależnie od tego, czy zapewnienia jakości Gemini 3.8 Live potwierdzą się w niezależnych testach, zabawa w dostępność już trwa.
---
Wyprzedź sztuczną inteligencjęOtrzymuj najnowsze wiadomości, analizy i przełomowe informacje dotyczące sztucznej inteligencji — wszystko w jednym miejscu.
Przeczytaj więcej aktualności o sztucznej inteligencji →