Tým Qwen společnosti Alibaba vydal Qwen-Image-2.1, nový model s otevřenou váhou pro generování a úpravy obrázků, který podle společnosti přesahuje jeho velikost. Podle týmu Qwen obsahuje komponent vizuálního generování modelu pouhých 7 miliard parametrů, přesto překonává většinu uzavřených modelů ve vlastním interním benchmarku Qwen – tvrzení, že pokud obstojí v nezávislém hodnocení, znamenalo by to významný posun v rovnováze mezi otevřeným a proprietárním generováním obrázků.
Model se 7 miliardami parametrů s ambicemi vlajkové lodi
Titulkové tvrzení Alibaby je zarážející: komponent vizuálního generování pouze 7 miliard parametrů překonávající většinu uzavřených modelů. Stojí za to zdůraznit upozornění, které to doprovází — srovnání pochází z vlastního benchmarku Qwen a výsledky nezávislých benchmarků stále čekají. Technická publikace The Decoder, která se zabývala vydáním, si tohoto rozdílu přímo všimla a komunita open source na Hacker News, kde spuštění získalo stovky kladných hlasů během několika hodin, byla ve svých prvních reakcích podobně hodnocena.
Co není sporné, je účinnost systému. Qwen-Image-2.1 je navržen tak, aby běžel na schopném spotřebitelském hardwaru, včetně GPU tak přístupných jako NVIDIA RTX 3090. Pro tvůrce a vývojáře, kteří sledovali, jak modely hraničních obrázků ustupují za rozhraní API a infrastrukturu datových center, je model, který dokáže generovat a upravovat obrázky lokálně na tři roky staré spotřebitelské kartě, smysluplným vývojem sám o sobě.
Transparentní obrázky a vícereferenční kompozice
Kromě kvality syrové generace přináší Qwen-Image-2.1 funkce, o kterých tým Qwen říká, že jsou pro tento model přirozené, než aby byly později přišroubovány. Nejpoutavější z nich je nativní podpora pro RGBA – obrázky s průhledným pozadím – při generování i úpravách. Uživatelé mohou izolovat objekty od jejich pozadí nebo měnit text na průhledných vrstvách, aniž by museli zahýbat pomocí samostatného nástroje pro odstranění pozadí.
Model také zpracuje až deset referenčních snímků v jedné úloze. Podle Qwen to umožňuje pracovní postupy, jako je sestavení skupinového portrétu z jednotlivých fotografií každého člověka, podpora virtuálních zkušebních zážitků nebo přepracování místností kombinací několika interiérových fotografií jako referencí.
Pro místní úpravy tým implementoval ovládací prvky řízené regiony: uživatelé mohou přes oblast obrázku kreslit kruhy, masky nebo malované značky, které označují, kde mají být změny aplikovány. To dává editačním pokynům vizuální formu, než se spoléhat pouze na textové výzvy k popisu prostorových změn.
Změny architektury a rychlejší vyvozování
Zlepšení výkonu v Qwen-Image-2.1 podle týmu Qwen pocházejí z architektonických změn az opětovného použití mezipaměti KV. Uvádí se, že přístup ukládání do mezipaměti znatelně urychluje odvození, zejména v pracovních postupech, které zahrnují více referenčních obrázků, kde by předchozí přístupy přepočítaly značné množství práce na každé generaci.
Pro praktické uživatele rychlejší dedukce na spotřební hardware umocňuje příběh dostupnosti: rychlejší cykly iterací umožňují generování místního obrazu pro skutečnou produkční práci spíše než pro příležitostné experimentování.
Kde to získat — a úlovek licencí
Qwen-Image-2.1 je k dispozici ke stažení na Hugging Face, GitHub a Model Scope a tým zveřejnil demo na Hugging Face pro uživatele, kteří si chtějí model před stažením vyzkoušet.
Pro komerční uživatele to však má důležitý háček. Model je dodáván na základě výzkumné licence, která výslovně zakazuje komerční použití. Firmy, které chtějí stavět na Qwen-Image-2.1, musí Qwen požádat o samostatnou licenci. To odráží přístup, který Alibaba zvolila u několika předchozích verzí Qwen, kde jsou váhy volně dostupné pro výzkum a hodnocení, ale nasazení generující příjmy vyžaduje přímou dohodu se společností.
Pro jednotlivé tvůrce, výzkumníky a fandy je praktický efekt jednoduchý: stáhnout, spustit lokálně, volně experimentovat. Pro začínající podniky, které doufají, že postaví produkt na vrcholu modelu, znamenají licenční podmínky rozhovor s Alibabou jako první.
Co to znamená pro závody Open-Weight
Vydání přichází v době, kdy čínské laboratoře umělé inteligence agresivně soutěží o efektivitu otevřené váhy a uvolňují modely, které se hlásí k hraniční kvalitě za zlomek počtu parametrů a nákladů na hardware oproti jejich uzavřeným konkurentům. Obrazový model, který tvrdí, že konkuruje uzavřeným systémům a zároveň se hodí na spotřebitelský GPU, je vizuálním protějškem této širší strategie.
Zda Qwen-Image-2.1 skutečně odpovídá uzavřeným lídrům, bude záviset na nezávislých benchmarcích, které ještě nebyly zveřejněny. Včasné komunitní testování, hodnocení třetích stran a srovnání na platformách, jako je Hugging Face, tuto otázku v nadcházejících týdnech vyřeší. Do té doby tvrzení zůstává na týmu – ale samotný model je dnes k dispozici každému, kdo má hardware a je zvědavý jej otestovat.
Pro čtenáře, kteří sledují širší konkurenci mezi otevřenými a uzavřenými systémy umělé inteligence, je vydání dalším datovým bodem v rychle se vyvíjejícím poli, který zahrnuje nejnovější zprávy o umělé inteligenci, jak se vyvíjí.
Udržujte si náskok před umělou inteligencí
Krajina umělé inteligence se pohybuje rychle a generování obrázků je jedním z nejkonkurenceschopnějších koutů. Sledujte AI Buzz Wire, kde najdete další informace o vydáních modelů, benchmarkech a obchodních rozhodnutích, která za nimi stojí.
Přečtěte si další zprávy o AI →