تیم Qwen علی بابا Qwen-Image-2.1 را منتشر کرده است، مدلی با وزن باز جدید برای تولید و ویرایش تصویر که به گفته این شرکت بسیار بالاتر از اندازه آن است. به گفته تیم Qwen، مولفه تولید بصری مدل فقط 7 میلیارد پارامتر دارد، با این حال بیشتر مدلهای بسته را در معیار داخلی خود Qwen شکست میدهد - ادعایی که اگر تحت ارزیابی مستقل باقی بماند، تغییر قابل توجهی در تعادل بین تولید تصویر باز و اختصاصی ایجاد میکند.
یک مدل پارامتری 7 میلیاردی با جاه طلبی های شاخص
ادعای اصلی علی بابا قابل توجه است: یک جزء تولید بصری تنها با 7 میلیارد پارامتر که از اکثر مدل های بسته بهتر عمل می کند. شایان ذکر است که این اخطار همراه با آن است - مقایسه از معیار خود Qwen حاصل شده است و نتایج معیار مستقل هنوز در انتظار است. نشریه فناوری The Decoder که انتشار را پوشش میدهد، مستقیماً به این تمایز اشاره کرده است و جامعه منبع باز در Hacker News، که در آن راهاندازی صدها رأی موافق در عرض چند ساعت به خود جلب کرد، به طور مشابه در واکنشهای اولیه آن اندازهگیری شده است.
چیزی که مورد بحث نیست کارایی سیستم است. Qwen-Image-2.1 برای اجرا بر روی سختافزار مصرفکننده توانمند، از جمله پردازندههای گرافیکی قابل دسترسی مانند NVIDIA RTX 3090 طراحی شده است. برای سازندگان و توسعهدهندگانی که مدلهای تصویر مرزی را در پشت APIها و زیرساختهای مرکز داده مشاهده کردهاند، مدلی که میتواند تصاویر را به صورت محلی روی کارت توسعهای سه ساله تولید و ویرایش کند، یک مدل است.
تصاویر شفاف و ترکیب چند مرجع
فراتر از کیفیت تولید خام، Qwen-Image-2.1 قابلیتهایی را معرفی میکند که تیم Qwen میگوید به جای اینکه بعداً روی آن نصب شود، بومی مدل هستند. چشم نوازترین آنها پشتیبانی بومی از RGBA - تصاویر با پس زمینه شفاف - در تولید و ویرایش است. کاربران میتوانند اشیاء را از پسزمینههایشان جدا کنند یا متن را روی لایههای شفاف بدون رفت و برگشت از طریق یک ابزار جداسازی پسزمینه تغییر دهند.
این مدل همچنین تا ده تصویر مرجع را در یک کار مدیریت می کند. به گفته Qwen، این کار جریانهای کاری مانند جمعآوری یک پرتره گروهی از عکسهای فردی هر فرد، تقویت تجربههای آزمایشی مجازی، یا طراحی مجدد اتاقها با ترکیب چندین عکس داخلی به عنوان مرجع را ممکن میسازد.
برای ویرایشهای محلی، تیم کنترلهای هدایتشده منطقه را پیادهسازی کرده است: کاربران میتوانند دایرهها، ماسکها یا علامتهای نقاشی شده را روی یک ناحیه از تصویر بکشند تا مشخص کنند که در کجا تغییرات باید اعمال شوند. این دستورات ویرایش را بهجای اتکای صرفاً به پیامهای متنی برای توصیف تغییرات فضایی، به شکل بصری قرار میدهد.
تغییرات معماری و استنتاج سریعتر
به گفته تیم Qwen، بهبود عملکرد در Qwen-Image-2.1 ناشی از تغییرات معماری و استفاده مجدد از حافظه پنهان KV است. گفته میشود که روش ذخیرهسازی استنتاج را بهطور قابلتوجهی سرعت میبخشد، بهویژه در جریانهای کاری که شامل تصاویر مرجع متعدد است، جایی که رویکردهای قبلی مقدار قابل توجهی از کار را در هر نسل دوباره محاسبه میکنند.
برای کاربران عملی، استنتاج سریعتر در مورد سختافزار مصرفکننده، داستان دسترسی را ترکیب میکند: چرخههای تکرار سریعتر، تولید تصویر محلی را برای کار تولید واقعی به جای آزمایشهای گاه به گاه، قابل دوام میسازد.
از کجا می توان آن را دریافت کرد - و گرفتن مجوز
Qwen-Image-2.1 برای دانلود در Hugging Face، GitHub و Model Scope در دسترس است و این تیم یک نسخه ی نمایشی در Hugging Face برای کاربرانی که می خواهند این مدل را قبل از دانلود آن امتحان کنند، منتشر کرده است.
با این حال، یک موضوع مهم برای کاربران تجاری وجود دارد. این مدل تحت مجوز تحقیقاتی ارسال می شود که به صراحت استفاده تجاری را ممنوع می کند. کسبوکارهایی که میخواهند روی Qwen-Image-2.1 بسازند، باید برای مجوز جداگانه به Qwen درخواست دهند. این منعکس کننده رویکردی است که علی بابا با چندین نسخه قبلی Qwen اتخاذ کرده است، جایی که وزنه ها به صورت رایگان برای تحقیق و ارزیابی در دسترس هستند، اما استقرار درآمدزایی نیاز به هماهنگی مستقیم با شرکت دارد.
برای خالقان، محققان و علاقمندان، اثر عملی ساده است: دانلود، اجرا به صورت محلی، آزمایش آزادانه. برای استارتآپهایی که امیدوارند محصولی بالاتر از مدل بسازند، شرایط مجوز به معنای صحبت با علیبابا است.
معنی آن برای مسابقه وزن آزاد
این نسخه در زمانی است که آزمایشگاههای هوش مصنوعی چینی به شدت در حال رقابت بر سر کارایی وزن باز هستند و مدلهایی را عرضه میکنند که ادعای کیفیت نزدیک به مرز را با کسری از تعداد پارامترها و هزینه سختافزار رقبای بسته خود دارند. مدل تصویری که ادعا میکند با سیستمهای بسته رقابت میکند در حالی که بر روی یک پردازنده گرافیکی مصرفکننده نصب میشود، همتای نسل بصری آن استراتژی گستردهتر است.
اینکه آیا Qwen-Image-2.1 واقعاً با رهبران بسته مطابقت دارد یا خیر، به معیارهای مستقلی بستگی دارد که هنوز منتشر نشده اند. آزمایش اولیه جامعه، ارزیابی های شخص ثالث و مقایسه در پلتفرم هایی مانند Hugging Face این سوال را در هفته های آینده حل خواهد کرد. تا آن زمان، این ادعا متعلق به تیم باقی می ماند - اما خود مدل امروز برای هر کسی که سخت افزار و کنجکاوی آزمایش آن را دارد در دسترس است.
برای خوانندگانی که رقابت گستردهتر بین سیستمهای هوش مصنوعی باز و بسته را دنبال میکنند، انتشار یک نقطه داده دیگر در زمینهای است که به سرعت در حال حرکت است که در کنار آخرین اخبار هوش مصنوعی در حین توسعه پوشش داده میشود.
از هوش مصنوعی جلوتر بمانید
چشم انداز هوش مصنوعی به سرعت حرکت می کند و تولید تصویر یکی از رقابتی ترین نقاط آن است. در [AI Buzz Wire] (https://aibuzzwire.news) برای ادامه پوشش نسخههای مدل، معیارها، و تصمیمهای تجاری پشت آنها همراه باشید.
اخبار هوش مصنوعی را بیشتر بخوانید →