Google spustil Gemini 3.8 Live a Gemini 3.8 Live Extended Thinking, pár modelů živého dialogu, které společnost popisuje jako dosud nejpokročilejší pro přirozenou hlasovou konverzaci. Modely se začaly zavádět 15. září přes rozhraní Gemini API, Google AI Studio, Search Live, Gemini Live a Google Workspace s podnikovým přístupem v soukromém náhledu prostřednictvím Gemini Enterprise.
Oznámení přišlo od Toma Ouyanga, hlavního inženýra, a Maliniho Jaganathana, člena technického personálu, píšícího jménem týmu Gemini Audio. Rozšiřuje rodinu Gemini 3.8, která debutovala na začátku tohoto měsíce, o modely Flash a Flash Cyber a představuje dosud nejagresivnější posun od Googlu do multimodální hlasové asistence v reálném čase – trh, kde hlasový režim OpenAI a vlna začínajících řečníků soutěží o stejný případ každodenního použití.
Uvedení na trh zapadá do pozoruhodně přeplněného úseku modelové řady Google; zpravodajství o [nejnovějším vývoji umělé inteligence] (https://aibuzzwire.news) ukazuje, že společnost nyní v rozmezí několika týdnů opakovaně dodává, protože bojuje s konkurenty v oblasti cen, kódování a nyní hlasu.
Vytvořeno pro konverzaci v reálném čase
To, co odlišuje Live modely od standardního chatovacího modelu s připojeným mikrofonem, je latence a stav. Dokumentace Live API společnosti Google popisuje rozhraní s nízkou latencí, které zpracovává nepřetržité toky zvuku, obrázků a textu přes stavové připojení WebSocket, přijímá nezpracovaný 16kHz zvuk PCM, obrázky JPEG rychlostí až jeden snímek za sekundu a text a vrací mluvený zvuk v reálném čase.
Modely zpracovávají vizuální vstupy téměř v reálném čase a umožňují asistentovi vidět to, co vidí uživatel – ukázková videa Google ukazují, jak Gemini 3.8 Live provází relaci nástupu zaměstnanců pomocí vizuálního kontextu, hraje šachy téměř v reálném čase a vytváří kompletní obchodní plány a vlastní marketingové sady prostřednictvím přirozené řeči. Modely mohou také detekovat a přecházet mezi 97 podporovanými jazyky automaticky uprostřed konverzace, aniž by uživatel přepínal nastavení.
Snad nejdůležitější pro praktické použití: modely provádějí nástroje a volání API na pozadí, zatímco konverzace pokračuje, potvrzují požadavky a udržují dialog v chodu, dokud se úkoly nedokončí. To promění asistenta z přísně tahového respondenta v něco bližšího agentovi, který náhodou mluví.
Čísla, která Google vychvaluje
Google hlásí, že Gemini 3.8 Live Extended Thinking obsadila nejvyšší celkovou pozici v indexu kvality řeči na řeč Artificial Analysis se skóre 82,6. Po dokončení agentního úkolu společnost uvádí 68,6 % v benchmarku τ-Voice a 35,1 % v hodnocení τ-Voice-banking společnosti Sierra, spolu se skóre 97,7 % v Big Bench Audio.
Toto jsou vlastní údaje společnosti Google a nezávislé ověření bude nějakou dobu trvat – ale pokud bude nárok na první místo v žebříčku umělé analýzy, bude Google v celkové kvalitě konverzace náskok před nabídkami OpenAI a specializovanými společnostmi využívajícími hlasovou umělou inteligenci, které jsou optimalizovány pro řeč. Google také říká, že Extended Thinking si udržuje vysoce konkurenční cenu, což je implicitní souhlas s cenovým tlakem, který definoval generaci 3.8.
Veškerý zvuk generovaný modely je opatřen vodoznakem SynthID, nepostřehnutelným vodoznakem společnosti Google, takže řeč generovaná umělou inteligencí zůstává detekovatelná – ochrana shody a dezinformací, která se stává standardem u generativních produktů Google.
Kde jej můžete použít
Dostupnost se u obou modelů liší. Gemini 3.8 Live je k dispozici všem ve službě Search Live, režimu vizuálního vyhledávání Google v reálném čase. Rozšířené myšlení je dostupné v Gemini Live, v Dokumentech pro předplatitele Google AI Pro a Ultra prostřednictvím Workspace a v Gmailu a Keep pro všechny uživatele Google.
Vývojáři získávají modely prostřednictvím Gemini API a Google AI Studio a Google říká, že Live API již používají platformy včetně Agora, Fishjam, LiveKit, Pipecat, Vercel a Vision Agents k vytváření hlasově řízených rozhraní nad infrastrukturou Google v reálném čase. Salesforce, Genspark a Lumeris jsou jmenováni jako uvedení partneři pro nové modely.
Přeplněný trh s hlasovou AI
Hlas se stává bitevním polem rozhraní roku 2026, protože je to místo, kde umělá inteligence konečně uniká z klávesnice. Model, který může vidět, poslouchat, přepínat jazyky a spouštět nástroje při hovoru, nesoutěží s jinými chatboty, ale s telefonním hovorem, linkou zákaznické podpory a osobním asistentem.
Výhodou Googlu je distribuce: Vyhledávání, Android, Workspace a Chrome dávají modelům Live instalovanou základnu, které se žádný konkurent nevyrovná. Společnost sází na to, že přítomnost v každém rohu dne uživatele – nyní se svými nejlepšími hlasovými modely – bude záležet více než jakákoliv výhra v benchmarku. Rivalové dostanou příležitost odpovědět, ale Google dal jasně najevo, že hlas, kdysi demo funkce, je nyní prvotřídní produktovou řadou.
Pro vývojáře je sdělení podobně přímé. Zveřejňováním přesných vstupních formátů, dokumentováním provádění nástrojů na pozadí a osazováním ekosystému platformami Live API se Google snaží udělat z tohoto balíčku výchozí substrát pro každého, kdo vytváří mluvená rozhraní – od robotů zákaznické podpory po nositelné asistenty. Ať už tvrzení o kvalitě Gemini 3.8 Live obstojí v nezávislém testování, hra o dostupnosti je již v pohybu.
---
Stay Ahead of AIZískejte nejnovější zprávy, analýzy a průlomové informace o umělé inteligenci – vše na jednom místě.
Přečtěte si další zprávy o AI →