Echipa Qwen a lui Alibaba a lansat Qwen-Image-2.1, un nou model deschis pentru generarea și editarea imaginilor despre care compania spune că este mult peste dimensiunea sa. Potrivit echipei Qwen, componenta de generare vizuală a modelului conține doar 7 miliarde de parametri, dar depășește majoritatea modelelor închise pe propriul benchmark intern al Qwen - o afirmație care, dacă se menține sub evaluare independentă, ar marca o schimbare notabilă a echilibrului între generarea de imagini deschise și proprietare.

Un model cu 7 miliarde de parametri cu ambiții emblematice

Afirmația principală de la Alibaba este izbitoare: o componentă de generare vizuală de doar 7 miliarde de parametri care depășește majoritatea modelelor închise. Merită să subliniem avertismentul care o însoțește - comparația provine din propriul benchmark Qwen, iar rezultatele benchmark-ului independente sunt încă în așteptare. Publicația tehnologică The Decoder, care a acoperit lansarea, a remarcat în mod direct această distincție, iar comunitatea open-source de pe Hacker News, unde lansarea a atras sute de voturi pozitive în câteva ore, au fost măsurate în mod similar în reacțiile sale timpurii.

Ceea ce nu este în discuție este eficiența sistemului. Qwen-Image-2.1 este proiectat să ruleze pe hardware de consum capabil, inclusiv GPU-uri la fel de accesibile ca un NVIDIA RTX 3090. Pentru creatorii și dezvoltatorii care au urmărit modelele de imagine de frontieră scăpați de API-uri și infrastructura centrului de date, un model care poate genera și edita imagini local pe un card de consum veche de trei ani este o dezvoltare semnificativă în sine.

Imagini transparente și compoziție cu mai multe referințe

Dincolo de calitatea brută de generare, Qwen-Image-2.1 introduce capacități despre care echipa Qwen spune că sunt native pentru model, mai degrabă decât sunt fixate ulterior. Cel mai atrăgător dintre acestea este suportul nativ pentru RGBA - imagini cu fundal transparent - atât la generare, cât și la editare. Utilizatorii pot izola obiectele din fundal sau pot schimba textul pe straturi transparente fără a face drum dus-întors printr-un instrument separat de eliminare a fundalului.

De asemenea, modelul gestionează până la zece imagini de referință într-o singură lucrare. Potrivit lui Qwen, acest lucru permite fluxuri de lucru precum asamblarea unui portret de grup din fotografii individuale ale fiecărei persoane, promovarea experiențelor virtuale de încercare sau reproiectarea camerelor prin combinarea mai multor fotografii interioare ca referințe.

Pentru editările locale, echipa a implementat controale ghidate de regiune: utilizatorii pot desena cercuri, măști sau semne pictate pe o zonă a unei imagini pentru a indica unde trebuie aplicate modificările. Acest lucru pune instrucțiunile de editare sub formă vizuală, mai degrabă decât să se bazeze doar pe solicitări de text pentru a descrie modificările spațiale.

Schimbări de arhitectură și inferență mai rapidă

Îmbunătățirile de performanță în Qwen-Image-2.1 provin din modificările arhitecturale și din reutilizarea memoriei cache KV, potrivit echipei Qwen. Se spune că abordarea de stocare în cache accelerează considerabil inferența, în special în fluxurile de lucru care implică mai multe imagini de referință, unde abordările anterioare ar recalcula o cantitate substanțială de muncă pentru fiecare generație.

Pentru utilizatorii practici, inferența mai rapidă asupra hardware-ului de consum agravează povestea accesibilității: ciclurile de iterație mai rapide fac generarea de imagini locale viabilă pentru munca de producție reală, mai degrabă decât experimentarea ocazională.

De unde să-l obțineți — și licența de captură

Qwen-Image-2.1 este disponibil pentru descărcare pe Hugging Face, GitHub și Model Scope, iar echipa a publicat o demonstrație pe Hugging Face pentru utilizatorii care doresc să încerce modelul înainte de a-l descărca.

Există, totuși, o captură importantă pentru utilizatorii comerciali. Modelul este livrat sub o licență de cercetare care interzice în mod explicit utilizarea comercială. Companiile care doresc să construiască pe Qwen-Image-2.1 trebuie să solicite Qwen pentru o licență separată. Acest lucru reflectă abordarea pe care Alibaba a adoptat-o ​​cu mai multe versiuni anterioare Qwen, unde ponderile sunt disponibile gratuit pentru cercetare și evaluare, dar implementările generatoare de venituri necesită un aranjament direct cu compania.

Pentru creatorii individuali, cercetătorii și pasionații, efectul practic este simplu: descărcați, rulați local, experimentați liber. Pentru startup-urile care speră să construiască un produs pe deasupra modelului, termenii licenței înseamnă că o conversație cu Alibaba este pe primul loc.

Ce înseamnă pentru cursa cu greutate deschisă

Lansarea ajunge într-un moment în care laboratoarele chineze de inteligență artificială concurează agresiv în ceea ce privește eficiența deschisă, lansând modele care pretind o calitate aproape de frontieră la o fracțiune din numărul de parametri și costul hardware al concurenților lor închiși. Un model de imagine care pretinde că rivalizează cu sistemele închise în timp ce se potrivește pe un GPU de consum este omologul de generație vizuală a acestei strategii mai ample.

Dacă Qwen-Image-2.1 se potrivește cu adevărat cu liderii închiși va depinde de benchmark-uri independente, care nu au fost încă publicate. Testarea timpurie a comunității, evaluările terțelor părți și comparațiile pe platforme precum Hugging Face vor rezolva problema în săptămânile următoare. Până atunci, revendicarea rămâne a echipei – dar modelul în sine este disponibil astăzi pentru oricine are hardware-ul și curiozitatea de a-l testa.

Pentru cititorii care urmăresc competiția mai largă dintre sistemele AI deschise și închise, lansarea este încă un punct de date într-un domeniu în mișcare rapidă, acoperit alături de cele mai recente știri despre AI pe măsură ce se dezvoltă.

Rămâi înaintea AI

Peisajul AI se mișcă rapid, iar generarea de imagini este unul dintre cele mai competitive colțuri ale sale. Urmăriți la AI Buzz Wire pentru o acoperire continuă a lansărilor de modele, a benchmark-urilor și a deciziilor de afaceri din spatele acestora.

Citiți mai multe știri AI →