Команда Alibaba Qwen випустила Qwen-Image-2.1, нову відкриту модель для генерації та редагування зображень, яка, за словами компанії, значно перевищує свій розмір. За словами команди Qwen, компонент візуальної генерації моделі містить лише 7 мільярдів параметрів, але він перевершує більшість закритих моделей за власним внутрішнім тестом Qwen — твердження, яке, якщо воно витримає незалежну оцінку, означатиме помітний зсув у балансі між відкритим і власним створенням зображень.

Модель із 7 мільярдами параметрів із флагманськими амбіціями

Заголовна заява Alibaba вражає: компонент візуальної генерації лише з 7 мільярдів параметрів перевершує більшість закритих моделей. Варто підкреслити застереження, яке супроводжує це — порівняння походить від власного тесту Qwen, а результати незалежного тесту все ще очікуються. Технічне видання The Decoder, яке висвітлювало випуск, прямо відзначило цю різницю, а спільнота відкритих вихідних кодів на Hacker News, де запуск зібрав сотні голосів «за» за кілька годин, також була оцінена у своїй ранній реакції.

Що не викликає суперечок, так це ефективність системи. Qwen-Image-2.1 розроблено для роботи на потужному споживчому апаратному забезпеченні, включаючи графічні процесори, такі ж доступні, як NVIDIA RTX 3090. Для творців і розробників, які спостерігали, як передові моделі зображень дрейфують позаду API та інфраструктури центру обробки даних, модель, яка може генерувати та редагувати зображення локально на споживчій картці трирічної давності, сама по собі є значущою розробкою.

Прозорі зображення та багатопосилальна композиція

Крім необробленої якості генерації, Qwen-Image-2.1 представляє можливості, які, за словами команди Qwen, є рідними для моделі, а не використані пізніше. Найпривабливішим із них є вбудована підтримка RGBA — зображень із прозорим фоном — як у створенні, так і в редагуванні. Користувачі можуть ізолювати об’єкти від фону або змінювати текст на прозорих шарах без повторного переходу за допомогою окремого інструменту для видалення фону.

Модель також обробляє до десяти еталонних зображень за одне завдання. За словами Qwen, це дає змогу виконувати такі робочі процеси, як складання групового портрета з окремих фотографій кожної людини, можливість віртуальної примірки або перепланування кімнат шляхом об’єднання кількох фотографій інтер’єру як зразків.

Для локального редагування команда реалізувала елементи керування, керовані регіонами: користувачі можуть малювати кола, маски або намальовані позначки над областю зображення, щоб вказати, де слід застосувати зміни. Завдяки цьому інструкції з редагування передаються у візуальну форму, а не покладаються лише на текстові підказки для опису просторових змін.

Зміни архітектури та швидший висновок

За словами команди Qwen, покращення продуктивності в Qwen-Image-2.1 відбувається завдяки змінам архітектури та повторному використанню кешу KV. Кажуть, що підхід до кешування помітно прискорює висновок, особливо в робочих процесах, які включають кілька еталонних зображень, де попередні підходи переобчислювали б значний обсяг роботи для кожного покоління.

Для практичних користувачів швидший аналіз споживчого апаратного забезпечення доповнює історію доступності: швидші цикли ітерацій роблять локальне створення зображень життєздатним для реальної виробничої роботи, а не випадкових експериментів.

Де взяти — і заковика ліцензування

Qwen-Image-2.1 доступний для завантаження на Hugging Face, GitHub і Model Scope, і команда опублікувала демонстрацію на Hugging Face для користувачів, які хочуть спробувати модель перед її завантаженням.

Однак для комерційних користувачів є важлива заковика. Модель постачається за дослідницькою ліцензією, яка прямо забороняє комерційне використання. Підприємства, які бажають створювати Qwen-Image-2.1, повинні звернутися до Qwen за окремою ліцензією. Це відображає підхід, застосований Alibaba до кількох попередніх випусків Qwen, де ваги є у вільному доступі для дослідження та оцінки, але розгортання, що приносить дохід, вимагає прямої домовленості з компанією.

Для індивідуальних творців, дослідників і любителів практичний ефект простий: завантажуйте, запускайте локально, вільно експериментуйте. Для стартапів, які сподіваються створити продукт на основі моделі, умови ліцензії означають, що розмова з Alibaba стоїть на першому місці.

Що це означає для гонки у відкритій вазі

Випуск відбувається в той час, коли китайські лабораторії штучного інтелекту агресивно конкурують за ефективність відкритої ваги, випускаючи моделі, які стверджують, що якість майже гранична за часткою кількості параметрів і вартості обладнання, ніж їхні закриті конкуренти. Модель зображення, яка претендує на те, щоб конкурувати із закритими системами, але встановлюється на споживчий GPU, є аналогом візуальної генерації цієї ширшої стратегії.

Чи справді Qwen-Image-2.1 відповідає закритим лідерам, залежатиме від незалежних тестів, які ще не опубліковані. Ранні тестування спільноти, сторонні оцінки та порівняння на таких платформах, як Hugging Face, вирішать це питання найближчими тижнями. До того часу претензія залишається за командою, але сама модель сьогодні доступна для всіх, хто має апаратне забезпечення та цікавість, щоб випробувати його.

Для читачів, які відстежують ширшу конкуренцію між відкритими та закритими системами штучного інтелекту, випуск є ще одним пунктом даних у галузі, яка швидко змінюється, і висвітлюється разом із останніми новинами штучного інтелекту по мірі розвитку.

Будьте попереду ШІ

Ландшафт штучного інтелекту швидко розвивається, і створення зображень є одним із найбільш конкурентоспроможних куточків. Слідкуйте за новинами на AI Buzz Wire, щоб продовжувати висвітлювати випуски моделей, контрольні показники та бізнес-рішення, які за ними стоять.

Читати більше новин AI →