Google tento týden v tichosti odeslal dvě významné aktualizace modelu Gemini během 48 hodin a obě jsou zaměřeny přímo na vývojáře vytvářející produkční aplikace. Gemini 3.5 Transscribe, představený 26. srpna, je podle oficiálního blogu společnosti Google dosud nejpřesnějším modelem převodu řeči na text společnosti. Gemini Omni 1.1 Flash, ohlášený 27. srpna, přináší ovládání generativního videa na profesionální úrovni, včetně prodloužení scény až na 40 sekund a zvýšení rozlišení 4K. Oba modely jsou dostupné prostřednictvím Gemini API v Google AI Studio a Gemini Enterprise Agent Platform.
Gemini 3.5 Transscribe: převod řeči na text, který se po sobě uklidí For more context on this story, see our ongoing AI trends.
Co odlišuje Gemini 3.5 Transcribe od konvenčního rozpoznávání řeči, říká Google, je to, že převádí nezpracovaný zvuk přímo na leštěný, formátovaný text, nikoli nezpracovaný přepis. Model si nativně poradí se šumem na pozadí, složitým žargónem a vyčištěním disfluence – odstraňuje výplňová slova jako „ums“ a „ahs“, řeší samoopravy jako „sejdeme se v úterý – ne, ve středu“ a automaticky formátuje výstup.
Srovnávací čísla uvedená Googlem jsou pozoruhodná. Jak bylo měřeno umělou analýzou, model dosahuje průměrné slovní chybovosti (WER) 4,0 procenta pro případy použití streamování a 2,6 procenta pro nestreamovaný zvuk. Ve vícejazyčném benchmarku FLEURS napříč nejlepšími jazyky vykazuje 5,50 procenta WER v režimu streamování a 5,04 procenta bez streamování, čímž se zlepšil předchozí přepisový model Google, Chirp 3. Čas do konečného přepisu se zlepšil o 70 procent ve srovnání s Chirp 3, opět podle měření pomocí umělé analýzy.
Model se dodává ve dvou variantách pro dva pracovní postupy. Pro živé aplikace poskytuje `gemini-3.5-transcribe-live` nepřetržité obousměrné streamování se subsekundovou latencí prostřednictvím Live API, zaměřené na hlasové agenty a titulky v reálném čase. Pro nahraný zvuk – schůzky, protokoly hovorů, archivy – nabízí `gemini-3.5-transcribe` přiřazení reproduktorů až pro tři reproduktory (s podporou více v experimentálním režimu) a časová razítka na úrovni slov prostřednictvím rozhraní Interactions API.
Mezi další funkce patří automatická detekce a přepis ve více než 85 jazycích se zpracováním přízvuku a dialektu a podpora vlastní slovní zásoby, takže se model přizpůsobí specializovanému žargonu a jedinečným pravopisům. Google také dal modelu oči: prostřednictvím volání funkcí může delegovat úkoly, jako je generování obrázků nebo analýza souborů, na jiné modely Gemini – funkce, která je aktuálně dostupná v aplikaci Gemini na macOS.
Gemini Omni 1.1 Flash: generování videa nabývá na časové ose
Druhé spuštění řeší nejčastější stížnost na video AI: ovládání. Gemini Omni 1.1 Flash je aktualizace zaměřená na produkci, díky níž je generativní video řiditelné způsobem, jakým jeho předchůdci nebyli, přičemž produktoví manažeři Google DeepMind Anish Nangia a Alisa Fortin popisují vydání tak, že je Omni 1.1 „připravené pro profesionální použití“.
Rozšíření scény je funkcí titulku. Vývojáři nyní mohou plynule pokračovat ve generování záběrů ze stávajícího klipu, přičemž model analyzuje až 10 sekund předchozího kontextu – skok od předchozích modelů, které odkazovaly pouze na poslední sekundu. Videa lze prodloužit v 10sekundových krocích až na kumulativní délku 40 sekund, což zlepšuje vizuální konzistenci a přilnavost vyprávění u delších příběhů.
Aktualizace také přidává interpolaci prvního a posledního snímku, což umožňuje vývojářům specifikovat počáteční a koncové snímky a vytvářet tak plynulé, záměrné pohyby kamery a přechody mezi snímky. Dokončené projekty lze před dodáním upscalovat na rozlišení 4K, zatímco režim náhledu 360p umožňuje tvůrcům rychle a levně opakovat výzvy, než se pustí do finálního vykreslení.
Od API po každodenní povrchy
Google také zapojuje oba modely do svých spotřebitelských produktů, což je místo, kde se projevuje jeho distribuční výhoda. Na Androidu používá nová funkce „Rambler“ v Gboardu 3.5 Transscribe k přeměně mluvených myšlenek na dobře formátovaný text a zároveň filtrování výplňových slov – uživatelé mohou provádět úpravy dokonce hlasem. Model také podporuje diktování v aplikaci Gemini na macOS, funguje s kontextem obrazovky v Google Antigravity a je integrován do Chromu.
Pro vývojáře se tato dvě spuštění chápou jako jedna strategie: Google tlačí Gemini z chatbota, se kterým mluvíte, do infrastruktury, která vidí, slyší a produkuje média. Vzhledem k tomu, že OpenAI, ElevenLabs a kohorta začínajících s videem soutěží na stejném území, 2,6 procenta slovní chybovosti a 40sekundové koherentní scény jsou úvodní nabídkou společnosti Google pro produkční úlohy, které skutečně generují příjmy – hlasové agenty, kanály pro vytváření titulků a kreativní nástroje. Vývojáři mohou začít stavět s oběma modely v Google AI Studio již dnes.
Proč na chybovosti slov stále záleží
Chybovost slov zní jako akademická statistika, ale ve výrobě je rozdíl mezi hlasovým produktem, který funguje, a produktem, který frustruje. Každý nepochopený výrok v hlasovém agentovi naruší úkol: špatně zaslechnuté ID objednávky spustí neúspěšné vyhledávání, zkomolená adresa odešle balíček do nesprávného města. To je důvod, proč se rozdíl mezi 2,6 procenty WER u nestreamovaného zvuku a vysokými jednocifernými sazbami, které byly běžné před generací modelů, spojuje v řádový rozdíl v použitelnosti.
Rozdíl mezi těmito dvěma režimy, o kterých Google informoval, je také důležitý pro architekty. Přepis streamování – údaj 4,0 procenta WER – vyměňuje určitou přesnost za subsekundovou latenci, kterou vyžadují interaktivní případy použití, jako jsou živí hlasoví agenti. Dávkový přepis nahraného zvuku běží pomaleji, ale dosahuje 2,6 procenta, a proto si analýzy po hovoru a zpracování archivu mohou dovolit být náročnější. Rozhodnutí společnosti Google vystavit oba jako samostatné koncové body modelu spíše než jedno nastavitelné nastavení uznává, že vývojáři vytvářejí různé produkty na obou stranách tohoto kompromisu.
Víceúrovňový pracovní postup pro produkci videa
Aktualizace Omni 1.1 Flash je stejně pragmatická ohledně toho, jak kreativní práce ve skutečnosti probíhá. Generativní video bylo nákladné opakovat: každý rychlý experiment znamenal úplné vykreslení. Nový režim náhledu 360p odděluje průzkum od zobrazování, umožňuje tvůrcům levně procházet rychlé variace a platit pouze za zvýšení rozlišení 4K u snímků, které přežijí kontrolu.
Mechanika rozšíření scény řeší problém koherence, který držel AI video v ghettu o velikosti klipu. Analýzou 10 sekund předchozího kontextu namísto pouhého posledního snímku může model prodloužit scénu v 10sekundových krocích až na 40 sekund při zachování konzistentnosti postav, osvětlení a vizuálního stylu. V kombinaci s interpolací prvního a posledního snímku – která dává editorům deterministické kontrolní body, způsob, jakým značky vstupů a výstupů fungují při konvenčních úpravách – se záběry generované umělou inteligencí začnou hodit do skutečných postprodukčních kanálů, spíše než je nahrazovat ve velkém.
Soutěžní obrázek
Obě uvedení staví Google spíše jako infrastrukturu než jako cíl. V řeči Google přebírá specializované dodavatele přepisů a hlasové zásobníky svých cloudových rivalů tím, že do rozhraní Gemini API, které již vývojáři používají, spojuje nejmodernější přesnost. Ve videu soutěží na trhu přeplněném dobře financovanými startupy tím, že klade důraz na kontrolu a integraci pracovních postupů před syrovou podívanou.
Rozhodujícím faktorem může být výhoda distribuce. Stejný přepisový model, který mohou vývojáři volat z Gemini API, již pohání diktování Rambler Gboard na Androidu, aplikaci Gemini na macOS, Google Antigravity a Chrome – což znamená, že Google může amortizovat vývoj modelu v rámci miliard uživatelských interakcí a zároveň shromažďovat různorodý zvuk z reálného světa, který jej neustále vylepšuje. Pro vývojáře, kteří si v roce 2026 zvolí sadu řeči nebo videa, je nyní tento setrvačník součástí nabídky.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →