تیم Qwen علی بابا Qwen-Image-2.1 را منتشر کرده است، مدلی با وزن باز جدید برای تولید و ویرایش تصویر که به گفته این شرکت بسیار بالاتر از اندازه آن است. به گفته تیم Qwen، مولفه تولید بصری مدل فقط 7 میلیارد پارامتر دارد، با این حال بیشتر مدل‌های بسته را در معیار داخلی خود Qwen شکست می‌دهد - ادعایی که اگر تحت ارزیابی مستقل باقی بماند، تغییر قابل توجهی در تعادل بین تولید تصویر باز و اختصاصی ایجاد می‌کند.

یک مدل پارامتری 7 میلیاردی با جاه طلبی های شاخص

ادعای اصلی علی بابا قابل توجه است: یک جزء تولید بصری تنها با 7 میلیارد پارامتر که از اکثر مدل های بسته بهتر عمل می کند. شایان ذکر است که این اخطار همراه با آن است - مقایسه از معیار خود Qwen حاصل شده است و نتایج معیار مستقل هنوز در انتظار است. نشریه فناوری The Decoder که انتشار را پوشش می‌دهد، مستقیماً به این تمایز اشاره کرده است و جامعه منبع باز در Hacker News، که در آن راه‌اندازی صدها رأی موافق در عرض چند ساعت به خود جلب کرد، به طور مشابه در واکنش‌های اولیه آن اندازه‌گیری شده است.

چیزی که مورد بحث نیست کارایی سیستم است. Qwen-Image-2.1 برای اجرا بر روی سخت‌افزار مصرف‌کننده توانمند، از جمله پردازنده‌های گرافیکی قابل دسترسی مانند NVIDIA RTX 3090 طراحی شده است. برای سازندگان و توسعه‌دهندگانی که مدل‌های تصویر مرزی را در پشت APIها و زیرساخت‌های مرکز داده مشاهده کرده‌اند، مدلی که می‌تواند تصاویر را به صورت محلی روی کارت توسعه‌ای سه ساله تولید و ویرایش کند، یک مدل است.

تصاویر شفاف و ترکیب چند مرجع

فراتر از کیفیت تولید خام، Qwen-Image-2.1 قابلیت‌هایی را معرفی می‌کند که تیم Qwen می‌گوید به جای اینکه بعداً روی آن نصب شود، بومی مدل هستند. چشم نوازترین آنها پشتیبانی بومی از RGBA - تصاویر با پس زمینه شفاف - در تولید و ویرایش است. کاربران می‌توانند اشیاء را از پس‌زمینه‌هایشان جدا کنند یا متن را روی لایه‌های شفاف بدون رفت و برگشت از طریق یک ابزار جداسازی پس‌زمینه تغییر دهند.

این مدل همچنین تا ده تصویر مرجع را در یک کار مدیریت می کند. به گفته Qwen، این کار جریان‌های کاری مانند جمع‌آوری یک پرتره گروهی از عکس‌های فردی هر فرد، تقویت تجربه‌های آزمایشی مجازی، یا طراحی مجدد اتاق‌ها با ترکیب چندین عکس داخلی به عنوان مرجع را ممکن می‌سازد.

برای ویرایش‌های محلی، تیم کنترل‌های هدایت‌شده منطقه را پیاده‌سازی کرده است: کاربران می‌توانند دایره‌ها، ماسک‌ها یا علامت‌های نقاشی شده را روی یک ناحیه از تصویر بکشند تا مشخص کنند که در کجا تغییرات باید اعمال شوند. این دستورات ویرایش را به‌جای اتکای صرفاً به پیام‌های متنی برای توصیف تغییرات فضایی، به شکل بصری قرار می‌دهد.

تغییرات معماری و استنتاج سریعتر

به گفته تیم Qwen، بهبود عملکرد در Qwen-Image-2.1 ناشی از تغییرات معماری و استفاده مجدد از حافظه پنهان KV است. گفته می‌شود که روش ذخیره‌سازی استنتاج را به‌طور قابل‌توجهی سرعت می‌بخشد، به‌ویژه در جریان‌های کاری که شامل تصاویر مرجع متعدد است، جایی که رویکردهای قبلی مقدار قابل توجهی از کار را در هر نسل دوباره محاسبه می‌کنند.

برای کاربران عملی، استنتاج سریع‌تر در مورد سخت‌افزار مصرف‌کننده، داستان دسترسی را ترکیب می‌کند: چرخه‌های تکرار سریع‌تر، تولید تصویر محلی را برای کار تولید واقعی به جای آزمایش‌های گاه به گاه، قابل دوام می‌سازد.

از کجا می توان آن را دریافت کرد - و گرفتن مجوز

Qwen-Image-2.1 برای دانلود در Hugging Face، GitHub و Model Scope در دسترس است و این تیم یک نسخه ی نمایشی در Hugging Face برای کاربرانی که می خواهند این مدل را قبل از دانلود آن امتحان کنند، منتشر کرده است.

با این حال، یک موضوع مهم برای کاربران تجاری وجود دارد. این مدل تحت مجوز تحقیقاتی ارسال می شود که به صراحت استفاده تجاری را ممنوع می کند. کسب‌وکارهایی که می‌خواهند روی Qwen-Image-2.1 بسازند، باید برای مجوز جداگانه به Qwen درخواست دهند. این منعکس کننده رویکردی است که علی بابا با چندین نسخه قبلی Qwen اتخاذ کرده است، جایی که وزنه ها به صورت رایگان برای تحقیق و ارزیابی در دسترس هستند، اما استقرار درآمدزایی نیاز به هماهنگی مستقیم با شرکت دارد.

برای خالقان، محققان و علاقمندان، اثر عملی ساده است: دانلود، اجرا به صورت محلی، آزمایش آزادانه. برای استارت‌آپ‌هایی که امیدوارند محصولی بالاتر از مدل بسازند، شرایط مجوز به معنای صحبت با علی‌بابا است.

معنی آن برای مسابقه وزن آزاد

این نسخه در زمانی است که آزمایشگاه‌های هوش مصنوعی چینی به شدت در حال رقابت بر سر کارایی وزن باز هستند و مدل‌هایی را عرضه می‌کنند که ادعای کیفیت نزدیک به مرز را با کسری از تعداد پارامترها و هزینه سخت‌افزار رقبای بسته خود دارند. مدل تصویری که ادعا می‌کند با سیستم‌های بسته رقابت می‌کند در حالی که بر روی یک پردازنده گرافیکی مصرف‌کننده نصب می‌شود، همتای نسل بصری آن استراتژی گسترده‌تر است.

اینکه آیا Qwen-Image-2.1 واقعاً با رهبران بسته مطابقت دارد یا خیر، به معیارهای مستقلی بستگی دارد که هنوز منتشر نشده اند. آزمایش اولیه جامعه، ارزیابی های شخص ثالث و مقایسه در پلتفرم هایی مانند Hugging Face این سوال را در هفته های آینده حل خواهد کرد. تا آن زمان، این ادعا متعلق به تیم باقی می ماند - اما خود مدل امروز برای هر کسی که سخت افزار و کنجکاوی آزمایش آن را دارد در دسترس است.

برای خوانندگانی که رقابت گسترده‌تر بین سیستم‌های هوش مصنوعی باز و بسته را دنبال می‌کنند، انتشار یک نقطه داده دیگر در زمینه‌ای است که به سرعت در حال حرکت است که در کنار آخرین اخبار هوش مصنوعی در حین توسعه پوشش داده می‌شود.

از هوش مصنوعی جلوتر بمانید

چشم انداز هوش مصنوعی به سرعت حرکت می کند و تولید تصویر یکی از رقابتی ترین نقاط آن است. در [AI Buzz Wire] (https://aibuzzwire.news) برای ادامه پوشش نسخه‌های مدل، معیارها، و تصمیم‌های تجاری پشت آن‌ها همراه باشید.

اخبار هوش مصنوعی را بیشتر بخوانید →