Echipa Qwen a lui Alibaba a lansat Qwen3.8-Omni-Flash, un model ommodal nativ de ultimă generație care acceptă intrări de text, imagine, audio și video printr-o singură fereastră de context de 1 milion de jetoane. Lansarea, detaliată pe blogul oficial Qwen, marchează cea mai agresivă forță a echipei de până acum de a transforma audio și video din intrări pasive în mediul principal prin care agenții AI percep și acționează asupra lumii.
De la înțelegerea mass-media până la acțiunea pe baza ei
Scopul declarat al Qwen3.8-Omni-Flash nu este doar o mai bună înțelegere a media. Potrivit echipei Qwen, modelul este conceput pentru a avansa sistemele ommodale de la „înțelegerea conținutului ommodal” la „planificarea sarcinilor, apelarea instrumentelor și finalizarea muncii creative”. În practică, asta înseamnă că modelul vizează fluxuri de lucru, cum ar fi editarea video, crearea de videoclipuri muzicale, producția de filme și comentariile, rezumarea audiovizuală și conversațiile vocale în timp real.
Această încadrare agentică separă lansarea de modelele multimodale anterioare care tratau audio și video ca intrări care trebuie transcrise sau descrise. Qwen susține că audio și video evoluează în „media de bază prin care agenții își înțeleg mediul, motivează și execută sarcini” - o afirmație pe care compania o susține cu o serie de rezultate de referință agentice.
Numerele din spatele lansării
În cadrul a 29 de evaluări care acoperă raționamentul audio, raționamentul audiovizual și punctele de referință ale agenților audiovizuali, Qwen spune că scorul mediu al modelului se îmbunătățește cu peste 25% față de predecesorul său, Qwen3.5-Omni-Plus. Rezultatele principale raportate pe blogul Qwen includ:
- Un câștig de 36,5 puncte pe WildClawBench-MM și 22,3 puncte pe AgenticVBench, două puncte de referință pentru agenții audiovizuali, plus un scor de 69,6 pe UniClawBench.
- O îmbunătățire de 8,3 puncte pentru LongAudioSpan și un câștig de 9,6 puncte pentru OmniVideoBench pentru înțelegerea audio și video de lungă durată.
- Scăderi dramatice ale ratei de eroare în transcrierea întâlnirilor cu mai mulți vorbitori: AliMeeting DER și cpWER ale modelului au scăzut de la 88,11 și 89,61 la 3,35 și, respectiv, 17,18.
Pe frontul competitiv, Qwen face o comparație directă cu oferta Google: compania susține performanțe audiovizuale apropiate de Gemini 3.8 Flash și performanțe audio generale care o depășesc. Verificarea independentă a acestor comparații va dura timp, dar specificul benchmark-ului arată că Qwen consideră modelul competitiv la frontiera muncii ommodale.
O fereastră de 1 milion de jetoane pentru ore de media
Fereastra de context unificată de 1 milion de token este probabil cea mai practică caracteristică a versiunii. Deoarece audio și video consumă jetoane mult mai repede decât textul, majoritatea modelelor multimodale din producție gestionează doar câteva minute de conținut media la un moment dat. O fereastră de context cu șapte cifre permite modelului să păstreze ore întregi de înregistrări ale întâlnirilor, înregistrări video extinse sau documente mari mixte într-o singură sesiune, fără a se fragmenta.
Qwen observă că modelul menține performanța textului comparabilă cu un model numai text de aceeași dimensiune - abordând compromisul comun în care antrenamentul ommodal degradează capacitatea pură de limbaj.
Reduceri de preț cu 98% la intrarea audio
Prețurile este locul în care Alibaba aplică cea mai mare presiune. Potrivit blogului, prețul API pe oră de intrare audio a scăzut cu mai mult de 98% în comparație cu Qwen3.5-Omni-Plus, în timp ce prețul pe oră de intrare audio-vizual a scăzut cu peste 93%. Nota de metodologie a companiei spune că prețurile pe oră sunt estimate la 30 de ori mai mult decât costul de intrare pentru două minute de material sursă, cu intrare audio-vizuală calculată la 720p și 1 cadru pe secundă.
Pentru dezvoltatorii care construiesc agenți vocali, rezumate de întâlniri sau conducte de analiză media, costul de intrare este adesea constrângerea obligatorie la scară. O scădere a prețurilor de două ordine de mărime schimbă produsele care sunt viabile din punct de vedere economic - aceeași dinamică care a condus primul val de API-uri ieftine de inferență de text.
Disponibilitate și ecosistem
Qwen3.8-Omni-Flash este disponibil acum pe platforma Qianwen AI, cu acces API prin Alibaba Cloud Model Studio, inclusiv un punct final dedicat în timp real pentru cazuri de utilizare conversaționale. Echipa a publicat, de asemenea, instrumente de susținere open-source pe GitHub, inclusiv cablajul de evaluare Qwen-Live-Harness și Qwen-MM-Plugins, oferind dezvoltatorilor un punct de plecare pentru construirea de agenți media nativi pe deasupra modelului.
Lansarea a aterizat liniștit la începutul săptămânii, dar a câștigat o acțiune semnificativă în comunitatea dezvoltatorilor în ultimele zile, atrăgând o discuție amplă despre Hacker News și acoperire de la magazinele de tehnologie care urmăresc ecosistemul model deschis.
Ce înseamnă pentru cursa ommodală
Lansarea continuă strategia Alibaba de a combina prețuri agresive cu benchmark-uri competitive în familia sa Qwen, care a fost în mod repetat printre cele mai descărcate descendențe de modele deschise din întreaga lume. Cu Qwen3.8-Omni-Flash, compania pariază că următorul câmp de luptă nu este chat-ul text, ci agenți care pot viziona, asculta și acționa - editarea imaginilor, rezumatul întâlnirilor și ținerea conversațiilor vocale în timp real ca o singură capacitate integrată.
Pentru Google, al cărui Flash Gemini 3.8 este punctul de comparație explicit, mesajul este că frontiera omni-modală nu mai este o cursă cu doi cai între laboratoarele din SUA. Pentru dezvoltatori, combinația dintre o fereastră multimodală de 1 milion de token și o intrare audio aproape gratuită reduce bariera în fața unei clase de produse de agenți audiovizuali care nu erau practic pentru a fi servite la scară cu doar câteva luni în urmă.
Indiferent dacă afirmațiile de referință ale Qwen rezistă în cadrul unei evaluări independente, va determina cât de serios tratează industria acel pariu. Dar direcția de deplasare este clară: echipele care construiesc modele de frontieră văd acum urechile și ochii – nu doar o casetă de text – ca interfață implicită pentru agenții AI.
Rămâi înaintea AI
Cursa ommodală se accelerează săptămână de săptămână. Pentru mai multe știri de ultimă oră AI, analiză aprofundată a lansărilor de modele noi și acoperire a instrumentelor care modelează industria, citește mai multe știri AI →.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →