Команда Alibaba Qwen запустила Qwen3.8-Omni-Flash, нативну омнімодну модель наступного покоління, яка приймає текст, зображення, аудіо та відео через одне контекстне вікно з 1 мільйоном маркерів. Реліз, детально описаний в офіційному блозі Qwen, знаменує собою найбільш агресивний поштовх команди, щоб перетворити аудіо та відео з пасивних вхідних даних на основне середовище, за допомогою якого агенти ШІ сприймають світ і діють на нього.

Від розуміння медіа до дії на них

Заявленою метою Qwen3.8-Omni-Flash є не просто краще розуміння медіа. За словами команди Qwen, модель розроблена для просування омнімодальних систем від «розуміння омнімодального вмісту» до «планування завдань, виклику інструментів і завершення творчої роботи». На практиці це означає, що модель призначена для таких робочих процесів, як редагування відео, створення музичних відео, створення фільмів і коментарів, аудіовізуальне підсумовування та голосові розмови в реальному часі.

Це агентне фреймування відокремлює випуск від попередніх мультимодальних моделей, які розглядали аудіо та відео як вхідні дані для транскрибування або опису. Qwen стверджує, що аудіо та відео перетворюються на «основне медіа, за допомогою якого агенти розуміють своє оточення, міркують і виконують завдання» — твердження, яке компанія підтверджує серією результатів агентського порівняльного тесту.

Цифри, що стоять за релізом

У 29 оцінках, що охоплюють аудіо-логічне мислення, аудіо-візуальне мислення та контрольні тести аудіо-візуальних агентів, Qwen каже, що середній бал моделі покращився більш ніж на 25% порівняно з її попередником Qwen3.5-Omni-Plus. Заголовні результати, про які повідомляється в блозі Qwen, включають:

  • Приріст 36,5 балів на WildClawBench-MM і 22,3 бала на AgenticVBench, двох тестах для аудіовізуальних агентів, плюс результат 69,6 на UniClawBench.
— Покращення на 8,3 бала в LongAudioSpan і на 9,6 бала в OmniVideoBench для розуміння довгого аудіо та відео.
  • Різке зниження частоти помилок у транскрипції зустрічі з кількома доповідачами: DER і cpWER AliMeeting моделі впали з 88,11 і 89,61 до 3,35 і 17,18 відповідно.

На конкурентному фронті Qwen проводить пряме порівняння з пропозицією Google: компанія стверджує, що аудіовізуальна продуктивність близька до Gemini 3.8 Flash, а загальна аудіо продуктивність перевищує її. Для незалежної перевірки цих порівнянь знадобиться час, але специфіка тестів сигналізує про те, що Qwen вважає модель конкурентоспроможною на межі омнімодальної роботи.

Вікно 1 млн токенів для годин медіа

Уніфіковане контекстне вікно з 1 мільйоном токенів є, мабуть, найбільш практичною функцією випуску. Оскільки аудіо та відео споживають маркери набагато швидше, ніж текст, більшість мультимодальних моделей у виробництві обробляють лише хвилини медіа за раз. Семизначне контекстне вікно дозволяє моделі зберігати багатогодинні записи зустрічей, розширені відеоматеріали або великі змішані мультимедійні документи в одному сеансі без фрагментації.

Qwen зазначає, що модель підтримує текстову продуктивність, порівнянну з текстовою моделлю такого ж розміру, вирішуючи загальний компроміс, коли омнімодальне навчання погіршує чисті мовні здібності.

Зниження ціни на аудіовхід на 98%.

Alibaba чинить найбільший тиск на ціноутворення. Відповідно до блогу, ціна API за годину введення аудіо впала більш ніж на 98% порівняно з Qwen3.5-Omni-Plus, тоді як ціна за годину аудіо-візуального введення впала більш ніж на 93%. У методологічній записці компанії зазначено, що погодинна ціна оцінюється як 30-кратна вартість вхідних даних двох хвилин вихідного матеріалу, аудіовізуальний вхід обчислюється як 720p і 1 кадр на секунду.

Для розробників, які створюють голосові агенти, підсумовувачі нарад або конвеєри аналізу медіа, вхідні витрати часто є обов’язковим обмеженням масштабу. Зниження ціни на два порядки величини змінює, які продукти є економічно життєздатними — та сама динаміка, яка спонукала першу хвилю дешевих API для виводу тексту.

Доступність і екосистема

Qwen3.8-Omni-Flash тепер доступний на платформі Qianwen AI Platform з API-доступом через Alibaba Cloud Model Studio, включаючи спеціальну кінцеву точку в реальному часі для розмовних випадків використання. Команда також опублікувала підтримку інструментів з відкритим вихідним кодом на GitHub, включаючи Qwen-Live-Harness і Qwen-MM-Plugins, що дає розробникам відправну точку для створення медіа-агентів на основі моделі.

Запуск відбувся тихо на початку тижня, але останніми днями набув значного розголосу серед спільноти розробників, викликавши широке обговорення в Hacker News і висвітлення технологічних джерел, які відстежують екосистему відкритої моделі.

Що це означає для омнімодальної раси

Випуск продовжує стратегію Alibaba щодо поєднання агресивних цін із конкурентоспроможними тестами в сімействі Qwen, яке неодноразово було одним із найбільш завантажуваних ліній відкритих моделей у всьому світі. З Qwen3.8-Omni-Flash компанія робить ставку на те, що наступним полем битви стане не текстовий чат, а агенти, які можуть дивитися, слухати та діяти — редагувати відзнятий матеріал, підсумовувати зустрічі та проводити голосові розмови в реальному часі як єдину інтегровану функцію.

Для Google, чий Gemini 3.8 Flash є прямою точкою порівняння, повідомлення полягає в тому, що омнімодальний кордон більше не є перегонами між лабораторіями США. Для розробників поєднання мультимодального вікна з 1 млн токенів і майже безкоштовного аудіовходу знижує бар’єр для класу продуктів аудіовізуальних агентів, які було непрактично обслуговувати в масштабі лише кілька місяців тому.

Від того, наскільки серйозно галузь ставиться до цієї ставки, залежатиме те, чи витримають твердження Qwen про контрольні показники незалежної оцінки. Але напрямок руху зрозумілий: команди, які створюють передові моделі, тепер бачать вуха та очі, а не просто текстове поле, як інтерфейс за замовчуванням для агентів ШІ.

Будьте попереду ШІ

Онімодальна гонка прискорюється щотижня. Щоб отримати більше останніх новин про штучний інтелект, поглиблений аналіз випусків нових моделей і висвітлення інструментів, які формують галузь, читайте більше новин про штучний інтелект →.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →