Команда Qwen из Alibaba запустила Qwen3.8-Omni-Flash, собственную омнимодальную модель следующего поколения, которая принимает ввод текста, изображений, аудио и видео через одно контекстное окно на 1 миллион токенов. Релиз, подробно описанный в официальном блоге Qwen, знаменует собой самый агрессивный шаг команды по превращению аудио и видео из пассивных входов в основную среду, с помощью которой агенты ИИ воспринимают мир и действуют в нем.
От понимания медиа к действиям на их основе
Заявленная цель Qwen3.8-Omni-Flash — не просто лучшее понимание медиа. По словам команды Qwen, модель предназначена для продвижения омнимодальных систем от «понимания омнимодального контента» к «планированию задач, вызову инструментов и завершению творческой работы». На практике это означает, что модель предназначена для таких рабочих процессов, как редактирование видео, создание музыкальных клипов, производство фильмов и комментирование, аудиовизуальное обобщение и голосовые разговоры в реальном времени.
Эта агентная структура отделяет выпуск от более ранних мультимодальных моделей, в которых аудио и видео рассматривались как входные данные, подлежащие расшифровке или описанию. Квен утверждает, что аудио и видео превращаются в «основные средства массовой информации, с помощью которых агенты понимают окружающую среду, рассуждают и выполняют задачи» — утверждение, которое компания подтверждает серией результатов тестов агентов.
Цифры, стоящие за релизом
По данным Qwen, по результатам 29 оценок, охватывающих аудиорассуждения, аудиовизуальные рассуждения и тесты аудиовизуальных агентов, средний балл модели улучшился более чем на 25% по сравнению с ее предшественницей, Qwen3.5-Omni-Plus. Заголовки результатов, опубликованные в блоге Qwen, включают:
- Прирост 36,5 баллов на WildClawBench-MM и 22,3 балла на AgenticVBench, два теста для аудиовизуальных агентов, а также балл 69,6 на UniClawBench.
- Улучшение на 8,3 балла в LongAudioSpan и на 9,6 балла в OmniVideoBench для понимания длинных аудио и видео.
- Значительное снижение количества ошибок при транскрипции собраний с несколькими докладчиками: показатели AliMeeting DER и cpWER упали с 88,11 и 89,61 до 3,35 и 17,18 соответственно.
Что касается конкуренции, Qwen проводит прямое сравнение с предложением Google: компания заявляет, что аудиовизуальная производительность близка к Gemini 3.8 Flash, а общая производительность звука превосходит ее. Независимая проверка этих сравнений потребует времени, но специфика заявлений тестов свидетельствует о том, что Квен считает модель конкурентоспособной на переднем крае омнимодальной работы.
Окно 1M-токена для часов медиа
Унифицированное контекстное окно на 1 миллион токенов, пожалуй, самая практичная функция релиза. Поскольку аудио и видео потребляют токены гораздо быстрее, чем текст, большинство мультимодальных моделей в производстве обрабатывают только несколько минут мультимедиа за раз. Семизначное контекстное окно позволяет модели хранить часы записей встреч, расширенные видеоматериалы или большие смешанные документы за один сеанс без разделения на фрагменты.
Квен отмечает, что модель обеспечивает производительность работы с текстом, сравнимую с текстовой моделью того же размера, что позволяет решить распространенный компромисс, когда омнимодальное обучение ухудшает чисто языковые способности.
Снижение цен на аудиовход на 98 %
Наибольшее давление Alibaba оказывает на ценообразование. По данным блога, цена API за час аудиоввода упала более чем на 98% по сравнению с Qwen3.5-Omni-Plus, а цена за час аудиовизуального ввода снизилась более чем на 93%. В методологической записке компании говорится, что почасовые цены оцениваются как 30-кратная стоимость двухминутного исходного материала, при этом аудиовизуальный ввод рассчитывается с разрешением 720p и частотой 1 кадр в секунду.
Для разработчиков, создающих голосовые агенты, средства суммирования собраний или конвейеры медиаанализа, стоимость входных данных часто является сдерживающим фактором масштаба. Падение цен на два порядка меняет то, какие продукты являются экономически жизнеспособными — та же самая динамика, которая привела к появлению первой волны дешевых API-интерфейсов для вывода текста.
Доступность и экосистема
Qwen3.8-Omni-Flash теперь доступен на платформе Qianwen AI с доступом к API через Alibaba Cloud Model Studio, включая выделенную конечную точку реального времени для диалоговых сценариев использования. Команда также опубликовала на GitHub вспомогательные инструменты с открытым исходным кодом, в том числе оценочный пакет Qwen-Live-Harness и Qwen-MM-Plugins, что дает разработчикам отправную точку для создания нативных медиа-агентов на основе модели.
Запуск состоялся в начале недели незаметно, но в последние дни он приобрел значительную популярность в сообществе разработчиков, вызвав широкую дискуссию на Hacker News и освещение в технологических агентствах, отслеживающих экосистему открытой модели.
Что это значит для омнимодальной расы
Этот выпуск продолжает стратегию Alibaba по сочетанию агрессивных цен с конкурентоспособными показателями в семействе Qwen, которое неоднократно входило в число самых загружаемых семейств открытых моделей в мире. С Qwen3.8-Omni-Flash компания делает ставку на то, что следующим полем битвы станет не текстовый чат, а агенты, которые могут смотреть, слушать и действовать — редактировать отснятый материал, подводить итоги встреч и вести голосовые разговоры в реальном времени как единую интегрированную возможность.
Для Google, чья версия Gemini 3.8 Flash является явным объектом сравнения, идея заключается в том, что омнимодальный фронтир больше не является гонкой на двух лошадях между лабораториями США. Для разработчиков сочетание мультимодального окна с токеном 1M и практически бесплатного аудиовхода снижает барьер для класса аудиовизуальных агентских продуктов, масштабное обслуживание которых всего несколько месяцев назад было непрактично.
От того, подтвердятся ли тестовые заявления Qwen независимой оценкой, будет зависеть, насколько серьезно индустрия отнесется к этой ставке. Но направление движения ясно: команды, создающие передовые модели, теперь видят уши и глаза, а не просто текстовое поле, как интерфейс по умолчанию для агентов ИИ.
Будьте впереди ИИ
Омнимодальная гонка ускоряется с каждой неделей. Чтобы получить больше последних новостей об искусственном интеллекте, углубленного анализа выпусков новых моделей и освещения инструментов, формирующих отрасль, [читайте больше новостей об искусственном интеллекте →] (https://aibuzzwire.news/en).
---
Будьте в курсе ИИПоследние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.
Читать больше новостей об ИИ →