Tým Qwen společnosti Alibaba spustil Qwen3.8-Omni-Flash, nativní omnimodální model nové generace, který přijímá textové, obrazové, zvukové a obrazové vstupy prostřednictvím jediného kontextového okna s 1 milionem tokenů. Vydání, podrobně popsané na oficiálním blogu Qwen, představuje dosud nejagresivnější snahu týmu přeměnit zvuk a video z pasivních vstupů na primární médium, jehož prostřednictvím agenti AI vnímají svět a působí na něj.
Od porozumění médiím k jednání s nimi
Stanoveným cílem Qwen3.8-Omni-Flash není jen lepší porozumění médiím. Podle týmu Qwen je model navržen tak, aby posouval omnimodální systémy od „pochopení omnimodálního obsahu“ k „plánování úkolů, volání nástrojů a dokončení kreativní práce“. V praxi to znamená, že model je zaměřen na pracovní postupy, jako je střih videa, tvorba hudebního videa, filmová produkce a komentáře, audiovizuální sumarizace a hlasové konverzace v reálném čase.
Toto agentní uspořádání odděluje vydání od dřívějších multimodálních modelů, které považovaly zvuk a video za vstupy, které mají být přepsány nebo popsány. Qwen tvrdí, že zvuk a video se vyvíjejí v „základní média, jejichž prostřednictvím agenti chápou své prostředí, důvody a vykonávají úkoly“ – toto tvrzení společnost podporuje řadou výsledků agentních benchmarků.
Čísla stojící za vydáním
Na základě 29 hodnocení zahrnujících zvukové uvažování, audiovizuální uvažování a srovnávací testy audiovizuálních agentů Qwen říká, že průměrné skóre modelu se oproti jeho předchůdci Qwen3.5-Omni-Plus zlepšilo o více než 25 %. Mezi hlavní výsledky uvedené na blogu Qwen patří:
- Zisk 36,5 bodu na WildClawBench-MM a 22,3 bodu na AgenticVBench, dva benchmarky pro audiovizuální agenty, plus skóre 69,6 na UniClawBench.
- Zlepšení o 8,3 bodu u LongAudioSpan a 9,6 bodový zisk u OmniVideoBench pro pochopení dlouhého zvuku a videa.
- Dramatický pokles chybovosti v přepisu setkání s více mluvčími: AliMeeting DER a cpWER modelu klesly z 88,11 a 89,61 na 3,35 a 17,18 v tomto pořadí.
Na konkurenční frontě provádí Qwen přímé srovnání s nabídkou společnosti Google: společnost tvrdí, že audiovizuální výkon se blíží Gemini 3.8 Flash a celkový zvukový výkon jej převyšuje. Nezávislé ověření těchto srovnání bude nějakou dobu trvat, ale specifičnost srovnávacích požadavků signalizuje, že Qwen považuje model za konkurenceschopný na hranici omnimodální práce.
Okno s 1 milionem tokenů na hodiny médií
Jednotné kontextové okno s 1 milionem tokenů je pravděpodobně nejpraktičtější funkcí vydání. Protože zvuk a video spotřebovávají tokeny mnohem rychleji než text, většina multimodálních modelů v produkci zpracovává pouze minuty médií najednou. Sedmimístné kontextové okno umožňuje modelu uchovávat hodiny nahrávek schůzek, rozšířené videozáznamy nebo velké dokumenty se smíšenými médii v jedné relaci, aniž by došlo k jejich rozsekávání.
Qwen poznamenává, že model zachovává textový výkon srovnatelný s čistě textovým modelem stejné velikosti – řeší běžný kompromis, kdy omnimodální školení degraduje čisté jazykové schopnosti.
Snížení ceny o 98 % na audio vstupu
Ceny jsou tam, kde Alibaba vyvíjí největší tlak. Podle blogu klesla cena API za hodinu audio vstupu o více než 98 % ve srovnání s Qwen3.5-Omni-Plus, zatímco cena za hodinu audio-vizuálního vstupu klesla o více než 93 %. Metodická poznámka společnosti uvádí, že hodinové ceny se odhadují jako 30násobek vstupních nákladů na dvě minuty zdrojového materiálu, přičemž audiovizuální vstup je počítán při 720p a 1 snímku za sekundu.
Pro vývojáře, kteří vytvářejí hlasové agenty, sumátory schůzek nebo kanály analýzy médií, jsou vstupní náklady často závazným omezením rozsahu. Pokles ceny o dva řády mění, které produkty jsou ekonomicky životaschopné – stejná dynamika, která vedla k první vlně levných API pro odvozování textu.
Dostupnost a ekosystém
Qwen3.8-Omni-Flash je nyní k dispozici na platformě Qianwen AI Platform s přístupem k API prostřednictvím Alibaba Cloud Model Studio, včetně vyhrazeného koncového bodu v reálném čase pro konverzační případy použití. Tým také zveřejnil podpůrné nástroje s otevřeným zdrojovým kódem na GitHubu, včetně hodnotícího svazku Qwen-Live-Harness a pluginů Qwen-MM-Plugins, což vývojářům poskytuje výchozí bod pro vytváření mediálních nativních agentů na vrcholu modelu.
Spuštění proběhlo v tichosti na začátku týdne, ale v posledních dnech získalo významnou trakci ve vývojářské komunitě, což vyvolalo velkou diskusi o Hacker News a pokrytí technologickými prodejnami sledujícími ekosystém otevřeného modelu.
Co to znamená pro omnimodální rasu
Vydání pokračuje ve strategii Alibaby, která spojuje agresivní ceny s konkurenčními benchmarky v rámci rodiny Qwen, která opakovaně patřila mezi nejstahovanější řady otevřených modelů po celém světě. S Qwen3.8-Omni-Flash společnost sází na to, že dalším bojištěm není textový chat, ale agenti, kteří mohou sledovat, poslouchat a jednat – upravovat záběry, sumarizovat schůzky a pořádat hlasové konverzace v reálném čase jako jediná integrovaná funkce.
Pro Google, jehož Gemini 3.8 Flash je explicitním srovnávacím bodem, zpráva zní, že omni-modální hranice již není závodem dvou koní mezi americkými laboratořemi. Pro vývojáře kombinace 1M-tokenového multimodálního okna a téměř bezplatného zvukového vstupu snižuje bariéru pro třídu produktů audiovizuálních agentů, které ještě před několika měsíci bylo nepraktické sloužit ve velkém měřítku.
To, zda se benchmarkové nároky Qwen udrží při nezávislém hodnocení, bude ovlivňovat, jak vážně průmysl s touto sázkou zachází. Ale směr cesty je jasný: týmy vytvářející hraniční modely nyní vidí uši a oči – nejen textové pole – jako výchozí rozhraní pro agenty AI.
Udržujte si náskok před AI
Všemodální závod se týden co týden zrychluje. Další nejnovější zprávy o AI, hloubkovou analýzu nových verzí modelů a pokrytí nástrojů, které formují průmysl, přečtěte si další zprávy o AI →.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →