Google spustil Gemini 3.5 Transscribe, nový model převodu řeči na text vytvořený pro přepis v reálném čase, který automaticky rozpozná více než 85 jazyků – a průběžně upravuje výstup, odstraňuje výplňová slova a opravuje verbální klopýtnutí, aniž by o to byl požádán.

Uvedení na trh staví zásobník řeči Google jako přímého vyzyvatele na rychle rostoucím trhu přepisů, kde přesnost a latence stále více rozhodují o tom, jaké služby vývojáři přijmou pro hovory, schůzky, titulky a hlasová rozhraní. For more context on this story, see our ongoing latest AI developments.

Co model dokáže

Podle oznámení společnosti Google, jehož pokrytí publikoval The Decoder, Gemini 3.5 Transcribe jde daleko nad rámec převodu mluvených slov na text:

  • Automatická detekce jazyka ve více než 85 jazycích bez nutnosti konfigurace
  • Odstranění výplňových slov, vyčištění "ehm", "ehm" a podobných nedůvěry
  • Oprava přemluvy, která vytváří čtivou prózu spíše než doslovný šum
  • Autonomní formátování textu, včetně interpunkce a struktury

Společnost hlásí míru chyb slov 4,0 procenta u streamovaného zvuku a 2,6 procenta u nahraného zvuku, spolu se snížením latence zhruba o 70 procent ve srovnání s jeho předchůdcem, Chirp 3 – podstatná rezerva ve scénářích živých titulků, kde zpoždění přeruší konverzaci.

Dvě rozhraní pro dvě úlohy

Vývojáři získají přístup prostřednictvím dvou odlišných rozhraní pro programování aplikací:

Live API — `gemini-3.5-transscribe-live`

Zvládá streamování v reálném čase s velmi nízkou latencí, cílí na živé titulky, hlasové agenty a interaktivní asistenty tam, kde nejvíce záleží na době odezvy.

Interactions API — `gemini-3.5-transscribe`

Zpracovává nahraný zvuk a vrací přepisy s uvedením řečníka a časovými razítky – pracovní postup typický pro schůzky, rozhovory, podcasty a mediální postprodukci.

Kromě přepisu model podporuje volání funkcí, což znamená, že může delegovat následné úkoly na jiné modely v rodině Gemini – například spuštění požadavku na generování obrázku nebo vyhledávání na webu na základě něčeho, co bylo řečeno během relace. Tím se přepisovací stroj změní na ovladatelnou vrstvu rozhraní pro hlasově řízené aplikace.

Již odesíláme produkty Google

Model je k dispozici ve Google AI Studio a na Gemini Enterprise Agent Platform pro vývojáře již dnes. Google jej také zavedl do spotřebitelských prostředí: Gboard na Androidu jej používá prostřednictvím interní komponenty zvané Rambler pro diktování, aplikace Gemini na macOS jej aplikuje na hlasový vstup a integrace Chromu má následovat.

Ta distribuce je důležitá. Rozpoznávání řeči si zasluhuje udržení velikosti a začlenění modelu do klávesnic, desktopových aplikací a prohlížečů jej staví před miliardy vstupních interakcí denně – a zároveň naplňuje vyhodnocovací smyčky potřebné k udržení klesající chybovosti napříč akcenty, dialekty a hlučným prostředím.

Konkurenční sázky v řeči AI

Přepis se v tichosti stal konkurenčním bojištěm mezi hraničními laboratořemi i specializovanými prodejci. Přesné porozumění řeči s nízkou latencí je vstupní vstupenkou pro agentní produkty, které fungují na základě mluvených příkazů, podnikových schůzek, funkcí pro usnadnění přístupu a vícejazyčné automatizace zákaznických služeb.

Spojením agresivních vylepšení latence se samoopravným výstupem Google sází na to, že vývojáři upřednostňují přepisy, které se čtou jako upravený text, spíše než surové fonetické zachycení – vyměňují striktní doslovnou věrnost za použitelnost. Týmy, které potřebují přesné záznamy, jako jsou právní nebo lékařské přepisovače, mohou stále chtít doslovné režimy; pro všechny ostatní se praktický rozdíl mezi někým slyšet a rozumět mu stále zmenšuje.

S Gemini 3.5 Transcribe, která je nyní běžně dostupná v AI Studio a podnikových nástrojích, bude prvním smysluplným testem metriky přijetí od vývojářů hlasových agentů – segment trhu, který roste dostatečně rychle, takže i přírůstkové zvýšení přesnosti se promítne do rozsáhlých rozhodnutí o přepínání.

Proč je latence skutečným bojištěm

Chybovost se dostává do hlavních zpráv, ale latence tiše určuje, které produkty jsou životaschopné. Přepisovací modul napájející překryvnou vrstvu s živými titulky musí držet krok s konverzací, jinak se diváci odpojí. Hlasový agent vyjednávající hovor na zákaznickou podporu se nemůže nepříjemně pozastavit, dokud jeho hlasová vrstva dohání. Google oznámil 70procentní snížení zpoždění ve srovnání s Chirp 3 se zaměřuje právě na tuto mezeru – zkrácení vzdálenosti mezi mluvčím, který dokončí větu, a následnými systémy, které na ni působí.

Pro agentní aplikace se toto skládá: každý obrat mluveného dialogu zahrnuje uznání, uvažování a reakci. Úspora milisekund od fáze rozpoznávání dává konstruktérům prostor, aby mohli utratit za schopnější – a pomalejší – modely uvažování, aniž by došlo k narušení rozpočtu na načasování konverzace.

Doslovný kompromis

Jedna designová volba si zaslouží kontrolu. Ve výchozím nastavení Gemini 3.5 Transcribe upravuje výstup: výplňová slova zmizí, klopýtnutí se opraví a formátování se použije automaticky. Pro většinu obchodních použití – minuty, titulky, prohledávatelné archivy – to je přesně to, co uživatelé chtějí.

Některé pracovní postupy však závisí na doslovných záznamech. Právní výpovědi, kontroly souladu a novinářské ověřování faktů někdy vyžadují přesné znalosti toho, co bylo řečeno, včetně váhání. Organizace v regulovaných odvětvích budou chtít mít jasno v tom, jak velká část vyhlazování je volitelná a konfigurovatelná před migrací citlivých potrubí na nový model. Dokumentace a parametry API společnosti Google efektivně nastaví, kde se v tomto odvětví nachází řada doslovně versus leštěná.

Vícejazyčná stopa jako příkop

Pokrytí více než 85 jazyků s automatickou detekcí není jen položkou kontrolního seznamu funkcí. Vícejazyčný dosah soustřeďuje hodnotu na trzích, kde konkurenti historicky zaostávají: regionální akcenty, přepínání kódu mezi jazyky uprostřed věty a jazyky s nízkými zdroji, to vše trestá modely trénované úzce na korpusy s vysokou angličtinou.

Pro globální podniky provozující centra podpory v desítkách zemí jediný model zpracovávající detekci jazyků transparentně snižuje složitost integrace – jeden kanál namísto mnoha konfigurací pro jednotlivé trhy. V kombinaci s distribucí prostřednictvím miliard instalací Androidu Gboardu společnost Google umisťuje vícejazyčnost v kvalitě přepisu spíše jako infrastrukturu než jako prémiovou funkci.

Na co se dívat

Tři signály ukážou, zda Gemini 3.5 Transcribe změní podíl na trhu nebo pouze zvýší očekávání: migrace vývojářů v benchmarcích třetích stran v nadcházejících měsících; jak rychle soupeři odpovídají číslům latence spíše než tvrzením o přesnosti; a zda háky vyvolávající funkce zplodí vlnu hlasových agentů nativně postavených na Gemini. Spuštění je nyní aktivní a cenové úrovně prostřednictvím AI Studio by měly experimentování zlevnit natolik, že náklady na přechod klesnou téměř na nulu.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →