Alibabas Qwen-team har lanserat Qwen3.8-Omni-Flash, en nästa generations inbyggd omnimodal modell som accepterar text, bild, ljud och videoingångar genom ett enda 1 miljon tokens sammanhangsfönster. Releasen, som beskrivs i den officiella Qwen-bloggen, markerar lagets mest aggressiva satsning hittills för att förvandla ljud och video från passiva ingångar till det primära mediet genom vilket AI-agenter uppfattar och agerar på världen.
Från att förstå media till att agera på det
Det uttalade målet med Qwen3.8-Omni-Flash är inte bara bättre medieförståelse. Enligt Qwen-teamet är modellen utformad för att utveckla omnimodala system från att "förstå omnimodalt innehåll" till "planera uppgifter, anropsverktyg och slutföra kreativt arbete." I praktiken betyder det att modellen är inriktad på arbetsflöden som videoredigering, skapande av musikvideor, filmproduktion och kommentarer, audiovisuell sammanfattning och röstsamtal i realtid.
Denna agentiska inramning skiljer utgivningen från tidigare multimodala modeller som behandlade ljud och video som ingångar som ska transkriberas eller beskrivas. Qwen hävdar att ljud och video utvecklas till "kärnmedia genom vilka agenter förstår sin miljö, resonerar och utför uppgifter" - ett påstående som företaget stöder med en rad agentiska riktmärkeresultat.
Siffrorna bakom releasen
Över 29 utvärderingar som spänner över ljudresonemang, audiovisuella resonemang och riktmärken för audiovisuella agenter, säger Qwen att modellens genomsnittliga poäng förbättras med mer än 25 % jämfört med föregångaren Qwen3.5-Omni-Plus. Rubrikresultaten som rapporteras på Qwen-bloggen inkluderar:
- En vinst på 36,5 poäng på WildClawBench-MM och 22,3 poäng på AgenticVBench, två riktmärken för audiovisuella agenter, plus en poäng på 69,6 på UniClawBench.
- En 8,3-punktsförbättring på LongAudioSpan och en 9,6-punktsförstärkning på OmniVideoBench för förståelse av ljud och video i långa former.
- Dramatiska felfrekvensfall i mötestranskription med flera högtalare: modellens AliMeeting DER och cpWER sjönk från 88,11 och 89,61 till 3,35 respektive 17,18.
På konkurrensfronten gör Qwen en direkt jämförelse med Googles erbjudande: företaget hävdar audiovisuell prestanda nära Gemini 3.8 Flash och övergripande ljudprestanda som överträffar den. Oberoende verifiering av dessa jämförelser kommer att ta tid, men riktmärkets specificitet signalerar att Qwen anser att modellen är konkurrenskraftig vid gränsen för omnimodalt arbete.
Ett 1M-token-fönster för timmar av media
Det förenade sammanhangsfönstret på 1 miljon token är utan tvekan releasens mest praktiska funktion. Eftersom ljud och video förbrukar tokens mycket snabbare än text, hanterar de flesta multimodala modeller i produktion endast några minuter av media åt gången. Ett sjusiffrigt sammanhangsfönster gör att modellen kan hålla timmar av mötesinspelningar, utökade videofilmer eller stora blandade mediadokument i en enda session utan att klippa.
Qwen noterar att modellen bibehåller textprestanda som är jämförbar med en textmodell av samma storlek – vilket tar itu med den vanliga avvägningen där omnimodal träning försämrar ren språkförmåga.
Prissänkningar på 98 % på ljudingång
Prissättningen är där Alibaba utövar mest press. Enligt bloggen har API-priset per timme för ljudingång sjunkit med mer än 98 % jämfört med Qwen3.5-Omni-Plus, medan priset per timme för audiovisuell ingång har sjunkit med mer än 93 %. Företagets metodanteckning säger att timpriserna uppskattas till 30 gånger ingångskostnaden för två minuter källmaterial, med audiovisuell ingång beräknad till 720p och 1 bild per sekund.
För utvecklare som bygger röstagenter, mötessammanfattningar eller medieanalyspipelines är insatskostnaden ofta den bindande begränsningen för skalan. Ett prisfall i två storleksordningar ändrar vilka produkter som är ekonomiskt lönsamma – samma dynamik som drev den första vågen av billiga textinferens-API:er.
Tillgänglighet och ekosystem
Qwen3.8-Omni-Flash är tillgängligt nu på Qianwen AI-plattformen, med API-åtkomst via Alibaba Cloud Model Studio, inklusive en dedikerad realtidsslutpunkt för konversationsanvändning. Teamet har också publicerat stödjande verktyg med öppen källkod på GitHub, inklusive Qwen-Live-Harness-utvärderingsselen och Qwen-MM-Plugins, vilket ger utvecklare en startpunkt för att bygga mediebaserade agenter ovanpå modellen.
Lanseringen landade tyst tidigare i veckan men fick betydande dragkraft i utvecklargemenskapen under de senaste dagarna, och drog till sig en stor diskussion om Hacker News och täckning från teknikbutiker som spårar ekosystemet med öppen modell.
Vad det betyder för det omnimodala loppet
Releasen fortsätter Alibabas strategi att para ihop aggressiv prissättning med konkurrenskraftiga riktmärken över hela sin Qwen-familj, som upprepade gånger har varit bland de mest nedladdade öppna modellerna i världen. Med Qwen3.8-Omni-Flash satsar företaget på att nästa slagfält inte är textchatt utan agenter som kan titta, lyssna och agera – redigera filmmaterial, sammanfatta möten och hålla röstsamtal i realtid som en enda integrerad funktion.
För Google, vars Gemini 3.8 Flash är den explicita jämförelsepunkten, är budskapet att den omnimodala gränsen inte längre är ett tvåhästkapplöpning mellan amerikanska labb. För utvecklare sänker kombinationen av ett 1M-token multimodalt fönster och nästan fri ljudingång barriären för en klass av audiovisuella agentprodukter som var opraktiska att tjäna i skala för bara månader sedan.
Huruvida Qwens benchmark-påståenden håller i sig under oberoende utvärdering kommer att forma hur seriöst branschen behandlar den satsningen. Men färdriktningen är tydlig: teamen som bygger gränsmodeller ser nu öron och ögon – inte bara en textruta – som standardgränssnittet för AI-agenter.
Ligg före AI
Det omnimodala loppet accelererar vecka för vecka. För fler senaste AI-nyheter, djupgående analys av nya modellsläpp och täckning av verktygen som formar branschen, läs mer AI-nyheter →.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →