Zespół Qwen Alibaba uruchomił Qwen3.8-Omni-Flash, natywny model omnimodalny nowej generacji, który akceptuje dane wejściowe tekstu, obrazu, dźwięku i wideo za pośrednictwem pojedynczego okna kontekstowego zawierającego 1 milion tokenów. Wydanie, którego szczegóły można znaleźć na oficjalnym blogu Qwen, stanowi najbardziej agresywne przedsięwzięcie zespołu mające na celu przekształcenie dźwięku i obrazu z pasywnych danych wejściowych w główne medium, za pośrednictwem którego agenci sztucznej inteligencji postrzegają świat i na niego oddziałują.
Od zrozumienia mediów do działania w oparciu o nie
Deklarowanym celem Qwen3.8-Omni-Flash jest nie tylko lepsze zrozumienie mediów. Według zespołu Qwen model ma na celu udoskonalenie systemów omnimodalnych od „rozumienia treści omnimodalnych” do „planowania zadań, wywoływania narzędzi i wykonywania pracy twórczej”. W praktyce oznacza to, że model jest ukierunkowany na takie procesy, jak montaż wideo, tworzenie teledysków, produkcja filmów i komentowanie, podsumowania audiowizualne oraz rozmowy głosowe w czasie rzeczywistym.
To agentyczne ramowanie oddziela wydanie od wcześniejszych modeli multimodalnych, które traktowały audio i wideo jako dane wejściowe do transkrypcji lub opisu. Qwen twierdzi, że audio i wideo ewoluują w „podstawowe media, dzięki którym agenci rozumieją swoje otoczenie, rozumują i wykonują zadania” – twierdzenie, które firma potwierdza serią wyników testów porównawczych agentów.
Liczby stojące za wydaniem
W 29 ocenach obejmujących rozumowanie dźwiękowe, rozumowanie audiowizualne i testy porównawcze agentów audiowizualnych Qwen twierdzi, że średni wynik modelu poprawił się o ponad 25% w porównaniu z jego poprzednikiem, Qwen3.5-Omni-Plus. Najważniejsze wyniki opublikowane na blogu Qwen obejmują:
- Wzrost o 36,5 punktu w WildClawBench-MM i 22,3 punktu w AgenticVBench, dwóch testach porównawczych dla agentów audiowizualnych, plus wynik 69,6 w UniClawBench.
- Dramatyczny spadek poziomu błędów w transkrypcji spotkań wielogłośnikowych: AliMeeting DER i cpWER modelu spadły odpowiednio z 88,11 i 89,61 do 3,35 i 17,18.
Na froncie konkurencyjnym Qwen dokonuje bezpośredniego porównania z ofertą Google: firma twierdzi, że wydajność audiowizualna jest bliska Gemini 3.8 Flash, a ogólna jakość dźwięku ją przewyższa. Niezależna weryfikacja tych porównań zajmie trochę czasu, ale specyfika twierdzeń benchmarku sygnalizuje, że Qwen uważa model za konkurencyjny na pograniczu pracy omnimodalnej.
Okno z żetonem 1 mln na wiele godzin multimediów
Ujednolicone okno kontekstowe zawierające 1 milion tokenów jest prawdopodobnie najbardziej praktyczną funkcją tej wersji. Ponieważ dźwięk i obraz zużywają tokeny znacznie szybciej niż tekst, większość modeli multimodalnych w środowisku produkcyjnym obsługuje jednorazowo tylko kilka minut multimediów. Siedmiocyfrowe okno kontekstowe umożliwia modelowi przechowywanie godzin nagrań spotkań, rozszerzonych materiałów wideo lub dużych dokumentów mieszanych w jednej sesji bez fragmentacji.
Qwen zauważa, że model utrzymuje wydajność tekstu porównywalną z modelem tekstowym o tym samym rozmiarze – uwzględniwszy powszechny kompromis, w przypadku którego szkolenie omnimodalne pogarsza umiejętności posługiwania się czystym językiem.
Obniżki cen o 98% na wejście audio
Ceny to obszar, na który Alibaba wywiera największą presję. Według bloga cena API za godzinę wejścia audio spadła o ponad 98% w porównaniu z Qwen3.5-Omni-Plus, podczas gdy cena za godzinę wejścia audio-wizualnego spadła o ponad 93%. W notatce metodologicznej firmy podano, że ceny godzinowe są szacowane jako 30-krotność kosztu wejściowego dwóch minut materiału źródłowego, przy wejściu audiowizualnym obliczanym w rozdzielczości 720p i 1 klatce na sekundę.
W przypadku programistów tworzących agenty głosowe, podsumowania spotkań lub potoki analizy multimediów koszt wejściowy jest często wiążącym ograniczeniem skali. Spadek cen o dwa rzędy wielkości powoduje zmianę tego, które produkty są opłacalne ekonomicznie — ta sama dynamika, która napędzała pierwszą falę tanich interfejsów API do wnioskowania tekstowego.
Dostępność i ekosystem
Qwen3.8-Omni-Flash jest już dostępny na platformie Qianwen AI z dostępem do API za pośrednictwem Alibaba Cloud Model Studio, w tym z dedykowanym punktem końcowym czasu rzeczywistego do zastosowań konwersacyjnych. Zespół opublikował także wspierające narzędzia typu open source w serwisie GitHub, w tym zestaw ewaluacyjny Qwen-Live-Harness i wtyczki Qwen-MM, dając programistom punkt wyjścia do tworzenia natywnych dla mediów agentów na podstawie modelu.
Premiera odbyła się spokojnie na początku tygodnia, ale w ostatnich dniach zyskała duże zainteresowanie wśród społeczności programistów, wywołując szeroką dyskusję w serwisie Hacker News i relacje ze sklepów technologicznych śledzących ekosystem modelu otwartego.
Co to oznacza dla rasy omnimodalnej
Wydanie to stanowi kontynuację strategii Alibaba polegającej na łączeniu agresywnych cen z konkurencyjnymi wzorcami w całej rodzinie Qwen, która wielokrotnie znajdowała się wśród najczęściej pobieranych linii modeli otwartych na świecie. Dzięki Qwen3.8-Omni-Flash firma obstawia, że kolejnym polem bitwy nie będą czaty tekstowe, ale agenci, którzy mogą oglądać, słuchać i działać — edytować nagrania, podsumowywać spotkania i prowadzić rozmowy głosowe w czasie rzeczywistym w ramach jednej zintegrowanej funkcji.
Dla Google, dla którego Gemini 3.8 Flash jest wyraźnym punktem porównawczym, sygnał jest taki, że granica omnimodalna nie jest już wyścigiem dwóch koni pomiędzy amerykańskimi laboratoriami. Dla programistów połączenie multimodalnego okna o wartości 1M i prawie bezpłatnego wejścia audio obniża barierę dla klasy produktów agentów audiowizualnych, które jeszcze kilka miesięcy temu były niepraktyczne w obsłudze na dużą skalę.
To, czy twierdzenia Qwen dotyczące benchmarków sprawdzą się w niezależnej ocenie, zadecyduje o tym, jak poważnie branża potraktuje ten zakład. Ale kierunek rozwoju jest jasny: zespoły budujące modele pionierskie widzą teraz uszy i oczy – a nie tylko pole tekstowe – jako domyślny interfejs dla agentów AI.
Wyprzedź sztuczną inteligencję
Wyścig omnimodalny nabiera tempa z tygodnia na tydzień. Aby uzyskać więcej najświeższych wiadomości o sztucznej inteligencji, dogłębną analizę nowych modeli i omówienie narzędzi kształtujących branżę, przeczytaj więcej aktualności o sztucznej inteligencji →.
---
Bądź na Bieżąco z AINajnowsze wiadomości, analizy i przełomy w dziedzinie AI — wszystko w jednym miejscu.
Czytaj więcej wiadomości AI →