Krea، استارت‌آپی که ابزارهای خلاقانه هوش مصنوعی می‌سازد، Krea 2 (K2) را منتشر کرده است، خانواده‌ای از مدل‌های پایه متن به تصویر با وزن باز که به گفته این شرکت در بین 10 تولیدکننده تصویر برتر در تابلوی تحلیل مصنوعی رتبه‌بندی و در میان مدل‌های آزمایشگاه‌های مستقل رتبه دوم را دارد. این نسخه که در گزارش فنی منتشر شده در 23 ژوئن 2026 به تفصیل شرح داده شده است، با دو ایست بازرسی مدل و یک مجوز مجاز ارسال می شود که جامعه را به تنظیم دقیق و ساخت بالای آن دعوت می کند.

برخلاف بسیاری از مدل‌های تصویر اخیر که برای یک خروجی پیش‌فرض صیقلی بهینه‌سازی می‌شوند، Krea Krea 2 را حول ایده کاوش خلاقانه طراحی کرد و توزیع بصری گسترده‌ای را به نمایش گذاشت که کاربران می‌توانند به جای تحمیل یک زیبایی شناسی محدود، آن را هدایت کنند. For more context on this story, see our ongoing AI news.

دو ایست بازرسی برای نیازهای مختلف

نسخه Krea 2 شامل دو ایست بازرسی مجزا است. اولین، K2 Raw، یک مدل پایه تقطیر نشده است که برای تحقیقات دقیق و پس از آموزش در نظر گرفته شده است، که به توسعه دهندگان پایه ای تمیز برای سازگاری می دهد. دومی، K2 Turbo، یک مدل تقطیر شده با راهنما و زمان است که برای تولید سریع و چند مرحله‌ای مهندسی شده است، نوعی تکرار سریع که جریان‌های کاری خلاقانه نیاز دارند.

ارائه یک پایگاه پژوهش پسند و یک نوع بهینه شده با سرعت، منعکس کننده یک تقسیم عملگرایانه است. محققان و قلاب‌زنان مدل خام را برای آزمایش می‌آورند، در حالی که کاربران تولیدی نقطه بازرسی سریع‌تری دریافت می‌کنند که به خاطر سرعت، کیفیت را فدا نمی‌کند.

موضع عمدی در برابر داده های آموزشی تولید شده توسط هوش مصنوعی

یکی از قابل توجه ترین ادعاها در گزارش فنی Krea مربوط به داده های آموزشی است. این تیم بیان می‌کند که در ترکیب پیش‌تمرینی خود از هیچ تصویر تولید شده توسط هوش مصنوعی استفاده نکرده است. در حالی که داده‌های مصنوعی و تقطیر به میانبرهای محبوبی برای دستیابی به قابلیت‌های مدل تبدیل شده‌اند، Krea دریافت که حتی بخش کوچکی از تصاویر تولید شده توسط هوش مصنوعی سوگیری‌هایی را در توزیع خروجی مدل ایجاد می‌کنند.

استدلال ساده است: یادگیری تصاویر مصنوعی برای یک مدل آسان تر است، که به طور موثر سقف مصنوعی را بر کیفیت تحمیل می کند. برای اجرای این خط‌مشی، Krea طبقه‌بندی‌کننده‌های داخلی را به‌طور خاص برای فیلتر کردن تصاویر تولید شده توسط هوش مصنوعی از مجموعه داده‌های خود، به جای تکیه بر فیلترهای خارج از قفسه، ساخت.

این شرکت همچنین دیدگاهی مخالف در مورد کیفیت داده ها داشت. به جای فیلتر کردن تهاجمی برای نمرات زیبایی شناختی بالا، که می تواند عمداً تصاویر تار، دانه دار یا غیر متعارف را که نشان دهنده انتخاب های هنری معتبر هستند حذف کند، کرا برای تنوع و پوشش دامنه وسیع بحث کرد. نتیجه می‌گوید، مدلی با دامنه بیانی گسترده‌تر از سیستم‌هایی است که فقط بر روی تصاویر زیبای معمولی آموزش دیده‌اند.

خط لوله معماری و آموزش

Krea 2 بر روی یک معماری ترانسفورماتور ساخته شده است که طراحی نهایی آن از طریق مطالعات فرسایشی گسترده مستند شده در گزارش انتخاب شده است. پس از آزمایش گزینه‌های جایگزین، تیم بر روی توجه پرس و جوی گروهی (GQA) با توجه سیگموئید دروازه‌ای، یک SwiGLU MLP و Qwen 3 VL به عنوان رمزگذار متن آن تصمیم گرفت. رمزگذاری موقعیتی از تعبیه‌های چرخشی محوری سه بعدی استفاده می‌کند و رمزگذار خودکار Qwen Image VAE و FLUX 2 AE را ترکیب می‌کند.

آموزش از یک برنامه درسی چند مرحله ای پیروی می کرد. پیش‌آموزش در مراحل رزولوشن 256 پیکسل، 512 پیکسل، و 1024 پیکسل پیش رفت و بخش عمده‌ای از محاسبات را به کارهایی با وضوح پایین اختصاص داد تا قابلیت‌های هسته را به‌طور کارآمد پیش از تیز کردن تولید با وضوح بالا در رزولوشن‌های بالاتر، ایجاد کنند. سپس یک مرحله آموزش میانی، توزیع گسترده پیش‌آموزشی و توزیع تنظیم دقیق نظارت‌شده با کیفیت بالا را با استفاده از خوشه‌بندی معنایی و استراتژی‌های مبتنی بر بازیابی برای حفظ پوشش مفاهیم کمیاب و طولانی پل زد.

ساختن نسل اکتشافی و هدایت پذیر

Krea یک شکاف دائمی بین نحوه آموزش مدل‌ها و نحوه ابراز تمایل کاربران را شناسایی کرد. در طول آموزش، مدل ها از زیرنویس های غنی و متراکم یاد می گیرند. در زمان استنتاج، کاربران اغلب به جای توصیف دقیق یک صحنه، اعلان‌های کوتاه و مبهم یا اشاره‌ای به حالت یا تصویر مرجع تایپ می‌کنند.

برای رفع این شکاف، Krea 2 با دو سیستم عرضه می شود. اولی یک توسعه دهنده سریع است که از طریق یک خط لوله یادگیری تقویتی و تنظیم دقیق نظارت شده دو مرحله ای در بالای مدل های زبان بزرگ منبع باز آموزش داده شده است، که دستورات ساده را در جهت های بصری غنی تر بدون بازنویسی قصد کاربر ترسیم می کند. دومی یک سیستم مرجع سبک است که به کاربران امکان می دهد سبک یا حالت یک یا چند تصویر مرجع را با حداقل نشت محتوا تزریق کنند و کنترل دقیقی بر قدرت سبک و ترکیب وزنی ارائه می دهد.

این اجزا با هم، Krea 2 را به عنوان یک رسانه اکتشافی دوباره تعریف می کنند. به جای بازگرداندن یک پاسخ واحد، این مدل به گونه ای طراحی شده است که فضایی از امکانات را در معرض دید قرار دهد و به کاربران راه های عملی برای حرکت در آن با استفاده از کنترل متن و تصویر مبتنی بر متن ارائه دهد.

حفظ دانش موجودات واقعی

یک قابلیت ظریف اما مهم برای هر تولید کننده تصویر، توانایی نمایش صادقانه موجودیت ها، افراد، مکان ها و اشیاء شناخته شده است که کاربران ممکن است به سادگی با نام به آنها اشاره کنند. کرا نگران بود که روش‌های نمونه‌گیری استاندارد ممکن است به‌طور تصادفی مفاهیم نادر یا مهم را در طول بررسی داده‌ها حذف کنند.

برای جلوگیری از این امر، تیم رتبه صفحه را بر روی ویکی‌پدیای انگلیسی اجرا کرد، 90 درصد مقاله‌های برتر را بر اساس رتبه حفظ کرد، مفاهیمی را که نمی‌توان به‌طور معنی‌داری به تصویر کشید فیلتر کرد، و سپس پوشش را در مجموعه داده‌های زیرنویس خود تأیید کرد، و تصاویری را که زیرنویس‌ها به مفاهیم کمیاب ارجاع می‌دادند، اولویت‌بندی کردند. تیم پس از آن تأیید کرد که هیچ مفهومی در مجموعه داده اولیه به طور کامل از نمونه آموزشی نهایی حذف نشده است.

یک مرز باز رقابتی برای تصویر هوش مصنوعی

ورود Krea 2 منظره تولید تصویر با وزن‌های باز شلوغ را تشدید می‌کند. این شرکت مدل خود را به عنوان "در میان 10 مدل برتر" در تابلوی تحلیل مصنوعی متن به تصویر و "مقام دوم در بین مدل‌های آزمایشگاه‌های مستقل" قرار می‌دهد، ادعایی که اگر تحت نظارت گسترده‌تر جامعه باشد، K2 را به یکی از قوی‌ترین تولیدکنندگان تصویر در دسترس تبدیل می‌کند.

این گزارش فنی که تقریباً 12000 کلمه دارد و همه چیز را از اصول مدیریت داده تا زیرساخت‌های آموزشی توزیع شده به تفصیل شرح می‌دهد، همچنین یک هدف استراتژیک را دنبال می‌کند. با انتشار روش شناسی پشت یک مدل رقابتی، Krea از بررسی، بازتولید و بهبود، ارز اعتبار در جامعه تحقیقاتی باز دعوت می کند.

برای سازندگان و توسعه‌دهندگان، نتیجه یک مدل تصویری قادر و دارای مجوز آشکار است که محدوده خلاق را بر یک پیش‌فرض ایمن اولویت می‌دهد. با وزنه‌های موجود در Hugging Face و کد موجود در GitHub، Krea 2 موانع را برای هر کسی که می‌خواهد بسازد، تنظیم دقیق کند یا به سادگی با یک تولیدکننده تصویر پیشرفته با شرایط خاص خود آزمایش کند، کاهش می‌دهد.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →