Zespół Qwen firmy Alibaba wypuścił Qwen-Image-2.1, nowy model o otwartej wadze do generowania i edycji obrazów, który według firmy znacznie przekracza jego rozmiar. Według zespołu Qwen komponent generowania wizualnego modelu zawiera zaledwie 7 miliardów parametrów, a mimo to pokonuje większość zamkniętych modeli w wewnętrznym benchmarku Qwen — twierdzenie, które, jeśli przejdzie niezależną ocenę, oznaczałoby zauważalną zmianę równowagi pomiędzy generowaniem obrazów otwartych i zastrzeżonych.

Model o parametrach 7 miliardów i sztandarowych ambicjach

Tytułowe twierdzenie Alibaba jest uderzające: komponent generujący obraz o zaledwie 7 miliardach parametrów, przewyższający większość zamkniętych modeli. Warto podkreślić towarzyszące mu zastrzeżenie — porównanie pochodzi z własnego benchmarku Qwen, a na wyniki niezależnych testów wciąż czekamy. Publikacja techniczna The Decoder, w której omówiono premierę, bezpośrednio odnotowała to rozróżnienie, a społeczność open source w serwisie Hacker News, gdzie premiera w ciągu kilku godzin zebrała setki głosów pozytywnych, została podobnie oceniona we wczesnych reakcjach.

To, co nie podlega dyskusji, to skuteczność systemu. Qwen-Image-2.1 został zaprojektowany do działania na wydajnym sprzęcie konsumenckim, w tym na procesorach graficznych tak dostępnych jak NVIDIA RTX 3090. Dla twórców i programistów, którzy obserwowali, jak pionierskie modele obrazów dryfują za interfejsami API i infrastrukturą centrum danych, model, który może generować i edytować obrazy lokalnie na trzyletniej karcie konsumenckiej, sam w sobie jest znaczącym osiągnięciem.

Przezroczyste obrazy i kompozycja zawierająca wiele odniesień

Oprócz jakości generowania surowców, Qwen-Image-2.1 wprowadza funkcje, które według zespołu Qwen są natywne dla modelu, a nie dodawane później. Najbardziej rzucającą się w oczy jest natywna obsługa RGBA — obrazów z przezroczystym tłem — zarówno podczas generowania, jak i edycji. Użytkownicy mogą izolować obiekty od tła lub zmieniać tekst na przezroczystych warstwach bez konieczności korzystania z osobnego narzędzia do usuwania tła.

Model obsługuje również do dziesięciu obrazów referencyjnych w jednym zadaniu. Według Qwen umożliwia to takie procesy, jak składanie portretu grupowego z indywidualnych zdjęć każdej osoby, umożliwianie wirtualnych prób lub przeprojektowywanie pokoi poprzez łączenie wielu zdjęć wnętrz jako odniesień.

W przypadku edycji lokalnych zespół wdrożył kontrolę regionalną: użytkownicy mogą rysować okręgi, maski lub malowane znaki na obszarze obrazu, aby wskazać, gdzie powinny zostać zastosowane zmiany. Dzięki temu instrukcje edycji mają formę wizualną, a nie polegają wyłącznie na podpowiedziach tekstowych w celu opisania zmian przestrzennych.

Zmiany w architekturze i szybsze wnioskowanie

Według zespołu Qwen ulepszenia wydajności w Qwen-Image-2.1 wynikają ze zmian architektonicznych i ponownego wykorzystania pamięci podręcznej KV. Mówi się, że metoda buforowania zauważalnie przyspiesza wnioskowanie, szczególnie w przepływach pracy obejmujących wiele obrazów referencyjnych, gdzie poprzednie podejścia wymagałyby ponownego obliczenia znacznej ilości pracy w każdym pokoleniu.

Dla praktycznych użytkowników szybsze wnioskowanie o sprzęcie konsumenckim komplikuje historię dostępności: szybsze cykle iteracji sprawiają, że lokalne generowanie obrazów jest opłacalne w przypadku rzeczywistej pracy produkcyjnej, a nie sporadycznych eksperymentów.

Gdzie to zdobyć — i haczyk związany z licencjonowaniem

Qwen-Image-2.1 można pobrać z Hugging Face, GitHub i Model Scope, a zespół opublikował wersję demonstracyjną Hugging Face dla użytkowników, którzy chcą wypróbować model przed pobraniem.

Istnieje jednak ważny haczyk dla użytkowników komercyjnych. Model jest objęty licencją badawczą, która wyraźnie zabrania wykorzystania komercyjnego. Firmy, które chcą korzystać z Qwen-Image-2.1, muszą wystąpić do Qwen o osobną licencję. Odzwierciedla to podejście Alibaba przyjęte w przypadku kilku poprzednich wydań Qwen, gdzie wagi są swobodnie dostępne do badań i oceny, ale wdrożenia generujące przychody wymagają bezpośredniego porozumienia z firmą.

Dla indywidualnych twórców, badaczy i hobbystów praktyczny efekt jest prosty: pobierz, uruchamiaj lokalnie i swobodnie eksperymentuj. W przypadku startupów, które chcą zbudować produkt na bazie modelu, warunki licencji oznaczają, że najważniejsza jest rozmowa z Alibaba.

Co to oznacza dla wyścigu w wadze otwartej

Premiera następuje w czasie, gdy chińskie laboratoria AI agresywnie konkurują w zakresie wydajności w otwartej wadze, wypuszczając modele, które zapewniają jakość niemal graniczną za ułamek liczby parametrów i kosztów sprzętu w porównaniu z zamkniętymi konkurentami. Model obrazu, który rzekomo konkuruje z systemami zamkniętymi, a jednocześnie jest montowany na konsumenckim procesorze graficznym, jest odpowiednikiem tej szerszej strategii w zakresie generowania wizualnego.

To, czy Qwen-Image-2.1 rzeczywiście dopasuje się do zamkniętych liderów, będzie zależeć od niezależnych testów porównawczych, które nie zostały jeszcze opublikowane. Wczesne testy społeczności, oceny stron trzecich i porównania na platformach takich jak Hugging Face rozstrzygną kwestię w nadchodzących tygodniach. Do tego czasu twierdzenia pozostają wyłączną własnością zespołu, ale sam model jest już dziś dostępny dla każdego, kto ma sprzęt i jest ciekawski, aby go przetestować.

Dla czytelników śledzących szerszą konkurencję między otwartymi i zamkniętymi systemami sztucznej inteligencji ta publikacja to kolejny punkt danych w szybko zmieniającej się dziedzinie, omawiany wraz z najnowszymi wiadomościami dotyczącymi sztucznej inteligencji w miarę jej rozwoju.

Wyprzedź sztuczną inteligencję

Krajobraz sztucznej inteligencji zmienia się szybko, a generowanie obrazów jest jednym z jego najbardziej konkurencyjnych obszarów. Obserwuj stronę AI Buzz Wire, aby otrzymywać dalsze relacje na temat premier modeli, testów porównawczych i stojących za nimi decyzji biznesowych.

Przeczytaj więcej aktualności o sztucznej inteligencji →