Het Qwen-team van Alibaba heeft Qwen3.8-Omni-Flash gelanceerd, een native omnimodaal model van de volgende generatie dat tekst-, beeld-, audio- en video-invoer accepteert via een enkel contextvenster van 1 miljoen tokens. De release, gedetailleerd op de officiële Qwen-blog, markeert de meest agressieve poging van het team tot nu toe om audio en video van passieve input om te zetten in het primaire medium waarmee AI-agenten de wereld waarnemen en ernaar handelen.

Van het begrijpen van media tot het ernaar handelen

Het gestelde doel van Qwen3.8-Omni-Flash is niet alleen een beter mediabegrip. Volgens het Qwen-team is het model ontworpen om omnimodale systemen vooruit te helpen, van 'het begrijpen van omnimodale inhoud' tot 'het plannen van taken, het aanroepen van tools en het voltooien van creatief werk'. In de praktijk betekent dit dat het model gericht is op workflows zoals videobewerking, het maken van muziekvideo's, filmproductie en commentaar, audiovisuele samenvattingen en realtime stemgesprekken.

Deze agentische framing scheidt de release van eerdere multimodale modellen die audio en video behandelden als input die moest worden getranscribeerd of beschreven. Qwen stelt dat audio en video evolueren naar "kernmedia waarmee agenten hun omgeving begrijpen, redeneren en taken uitvoeren" - een claim die het bedrijf ondersteunt met een reeks agentische benchmarkresultaten.

De cijfers achter de release

Uit 29 evaluaties op het gebied van audio-redeneren, audio-visueel redeneren en benchmarks voor audio-visuele agenten blijkt dat de gemiddelde score van het model met meer dan 25% is verbeterd ten opzichte van zijn voorganger, Qwen3.5-Omni-Plus. De belangrijkste resultaten die op de Qwen-blog worden gerapporteerd, zijn onder meer:

  • Een winst van 36,5 punten op WildClawBench-MM en 22,3 punten op AgenticVBench, twee benchmarks voor audiovisuele agenten, plus een score van 69,6 op UniClawBench.
  • Een verbetering van 8,3 punten op LongAudioSpan en een winst van 9,6 punten op OmniVideoBench voor begrip van lange audio- en videobeelden.
  • Dramatische daling van het foutenpercentage bij de transcriptie van vergaderingen met meerdere sprekers: de AliMeeting DER en cpWER van het model daalden van respectievelijk 88,11 en 89,61 naar 3,35 en 17,18.

Op het gebied van de concurrentie maakt Qwen een directe vergelijking met het aanbod van Google: het bedrijf claimt audiovisuele prestaties die dicht bij Gemini 3.8 Flash liggen en de algehele audioprestaties die deze overtreffen. Onafhankelijke verificatie van die vergelijkingen zal tijd vergen, maar de specificiteit van de benchmarkclaims geeft aan dat Qwen het model als concurrerend beschouwt aan de grens van omnimodaal werk.

Een 1M-tokenvenster voor urenlang mediaplezier

Het uniforme contextvenster van 1 miljoen token is misschien wel de meest praktische functie van de release. Omdat audio en video veel sneller tokens verbruiken dan tekst, verwerken de meeste multimodale modellen in productie slechts enkele minuten aan media tegelijk. Dankzij een contextvenster van zeven cijfers kan het model urenlang vergaderopnames, uitgebreide videobeelden of grote gemengde mediadocumenten in één sessie opslaan zonder dat het in stukken wordt gesneden.

Qwen merkt op dat het model de tekstprestaties handhaaft die vergelijkbaar zijn met die van een model met alleen tekst van dezelfde omvang, waarmee de gemeenschappelijke wisselwerking wordt aangepakt waarbij omnimodale training de pure taalvaardigheid aantast.

Prijsverlagingen van 98% op audio-invoer

Op de prijzen oefent Alibaba de meeste druk uit. Volgens de blog is de API-prijs per uur audio-invoer met ruim 98% gedaald vergeleken met Qwen3.5-Omni-Plus, terwijl de prijs per uur audiovisuele invoer met ruim 93% is gedaald. In de methodologienota van het bedrijf staat dat de uurprijzen worden geschat op 30 maal de inputkosten van twee minuten bronmateriaal, waarbij de audiovisuele input wordt berekend op 720p en 1 frame per seconde.

Voor ontwikkelaars die stemagenten, samenvattingen van vergaderingen of pijplijnen voor media-analyse bouwen, zijn inputkosten vaak de bindende beperking op schaal. Een prijsdaling van twee ordes van grootte verandert welke producten economisch levensvatbaar zijn – dezelfde dynamiek die de eerste golf van goedkope tekstinferentie-API’s aandreef.

Beschikbaarheid en ecosysteem

Qwen3.8-Omni-Flash is nu beschikbaar op het Qianwen AI Platform, met API-toegang via Alibaba Cloud Model Studio, inclusief een speciaal realtime eindpunt voor conversatiegebruik. Het team heeft ook ondersteunende open-source tools op GitHub gepubliceerd, waaronder het Qwen-Live-Harness evaluatieharnas en Qwen-MM-Plugins, waardoor ontwikkelaars een startpunt hebben voor het bouwen van media-native agenten bovenop het model.

De lancering vond eerder deze week rustig plaats, maar kreeg de afgelopen dagen aanzienlijke grip in de ontwikkelaarsgemeenschap, wat leidde tot een grote discussie op Hacker News en berichtgeving van technologiebedrijven die het open-model-ecosysteem volgen.

Wat het betekent voor het omnimodale ras

De release zet de strategie van Alibaba voort om agressieve prijzen te combineren met concurrerende benchmarks binnen de Qwen-familie, die herhaaldelijk tot de meest gedownloade open-modellijnen ter wereld behoort. Met Qwen3.8-Omni-Flash gokt het bedrijf erop dat het volgende slagveld niet tekstchat is, maar agenten die kunnen kijken, luisteren en handelen – beeldmateriaal bewerken, vergaderingen samenvatten en realtime spraakgesprekken voeren als één enkele geïntegreerde mogelijkheid.

Voor Google, wiens Gemini 3.8 Flash het expliciete vergelijkingspunt is, is de boodschap dat de omnimodale grens niet langer een race tussen twee paarden tussen Amerikaanse laboratoria is. Voor ontwikkelaars verlaagt de combinatie van een multimodaal venster met 1M-token en vrijwel gratis audio-invoer de barrière voor een klasse audiovisuele agentproducten die nog maar enkele maanden geleden onpraktisch waren om op grote schaal te dienen.

Of de benchmarkclaims van Qwen stand houden onder onafhankelijke evaluatie, zal bepalen hoe serieus de industrie deze weddenschap behandelt. Maar de reisrichting is duidelijk: de teams die grensmodellen bouwen, zien nu oren en ogen (niet alleen een tekstvak) als de standaardinterface voor AI-agenten.

Blijf AI een stap voor

De omnimodale race versnelt week na week. Voor meer actueel AI-nieuws, een diepgaande analyse van nieuwe modelreleases en berichtgeving over de tools die de industrie vormgeven, lees meer AI-nieuws →.

---

Blijf Voorop met AI

Het laatste AI-nieuws, analyses en doorbraken — allemaal op één plek.

Lees meer AI-nieuws →