Krea، استارتآپی که ابزارهای خلاقانه هوش مصنوعی میسازد، Krea 2 (K2) را منتشر کرده است، خانوادهای از مدلهای پایه متن به تصویر با وزن باز که به گفته این شرکت در بین 10 تولیدکننده تصویر برتر در تابلوی تحلیل مصنوعی رتبهبندی و در میان مدلهای آزمایشگاههای مستقل رتبه دوم را دارد. این نسخه که در گزارش فنی منتشر شده در 23 ژوئن 2026 به تفصیل شرح داده شده است، با دو ایست بازرسی مدل و یک مجوز مجاز ارسال می شود که جامعه را به تنظیم دقیق و ساخت بالای آن دعوت می کند.
برخلاف بسیاری از مدلهای تصویر اخیر که برای یک خروجی پیشفرض صیقلی بهینهسازی میشوند، Krea Krea 2 را حول ایده کاوش خلاقانه طراحی کرد و توزیع بصری گستردهای را به نمایش گذاشت که کاربران میتوانند به جای تحمیل یک زیبایی شناسی محدود، آن را هدایت کنند. For more context on this story, see our ongoing AI news.
دو ایست بازرسی برای نیازهای مختلف
نسخه Krea 2 شامل دو ایست بازرسی مجزا است. اولین، K2 Raw، یک مدل پایه تقطیر نشده است که برای تحقیقات دقیق و پس از آموزش در نظر گرفته شده است، که به توسعه دهندگان پایه ای تمیز برای سازگاری می دهد. دومی، K2 Turbo، یک مدل تقطیر شده با راهنما و زمان است که برای تولید سریع و چند مرحلهای مهندسی شده است، نوعی تکرار سریع که جریانهای کاری خلاقانه نیاز دارند.
ارائه یک پایگاه پژوهش پسند و یک نوع بهینه شده با سرعت، منعکس کننده یک تقسیم عملگرایانه است. محققان و قلابزنان مدل خام را برای آزمایش میآورند، در حالی که کاربران تولیدی نقطه بازرسی سریعتری دریافت میکنند که به خاطر سرعت، کیفیت را فدا نمیکند.
موضع عمدی در برابر داده های آموزشی تولید شده توسط هوش مصنوعی
یکی از قابل توجه ترین ادعاها در گزارش فنی Krea مربوط به داده های آموزشی است. این تیم بیان میکند که در ترکیب پیشتمرینی خود از هیچ تصویر تولید شده توسط هوش مصنوعی استفاده نکرده است. در حالی که دادههای مصنوعی و تقطیر به میانبرهای محبوبی برای دستیابی به قابلیتهای مدل تبدیل شدهاند، Krea دریافت که حتی بخش کوچکی از تصاویر تولید شده توسط هوش مصنوعی سوگیریهایی را در توزیع خروجی مدل ایجاد میکنند.
استدلال ساده است: یادگیری تصاویر مصنوعی برای یک مدل آسان تر است، که به طور موثر سقف مصنوعی را بر کیفیت تحمیل می کند. برای اجرای این خطمشی، Krea طبقهبندیکنندههای داخلی را بهطور خاص برای فیلتر کردن تصاویر تولید شده توسط هوش مصنوعی از مجموعه دادههای خود، به جای تکیه بر فیلترهای خارج از قفسه، ساخت.
این شرکت همچنین دیدگاهی مخالف در مورد کیفیت داده ها داشت. به جای فیلتر کردن تهاجمی برای نمرات زیبایی شناختی بالا، که می تواند عمداً تصاویر تار، دانه دار یا غیر متعارف را که نشان دهنده انتخاب های هنری معتبر هستند حذف کند، کرا برای تنوع و پوشش دامنه وسیع بحث کرد. نتیجه میگوید، مدلی با دامنه بیانی گستردهتر از سیستمهایی است که فقط بر روی تصاویر زیبای معمولی آموزش دیدهاند.
خط لوله معماری و آموزش
Krea 2 بر روی یک معماری ترانسفورماتور ساخته شده است که طراحی نهایی آن از طریق مطالعات فرسایشی گسترده مستند شده در گزارش انتخاب شده است. پس از آزمایش گزینههای جایگزین، تیم بر روی توجه پرس و جوی گروهی (GQA) با توجه سیگموئید دروازهای، یک SwiGLU MLP و Qwen 3 VL به عنوان رمزگذار متن آن تصمیم گرفت. رمزگذاری موقعیتی از تعبیههای چرخشی محوری سه بعدی استفاده میکند و رمزگذار خودکار Qwen Image VAE و FLUX 2 AE را ترکیب میکند.
آموزش از یک برنامه درسی چند مرحله ای پیروی می کرد. پیشآموزش در مراحل رزولوشن 256 پیکسل، 512 پیکسل، و 1024 پیکسل پیش رفت و بخش عمدهای از محاسبات را به کارهایی با وضوح پایین اختصاص داد تا قابلیتهای هسته را بهطور کارآمد پیش از تیز کردن تولید با وضوح بالا در رزولوشنهای بالاتر، ایجاد کنند. سپس یک مرحله آموزش میانی، توزیع گسترده پیشآموزشی و توزیع تنظیم دقیق نظارتشده با کیفیت بالا را با استفاده از خوشهبندی معنایی و استراتژیهای مبتنی بر بازیابی برای حفظ پوشش مفاهیم کمیاب و طولانی پل زد.
ساختن نسل اکتشافی و هدایت پذیر
Krea یک شکاف دائمی بین نحوه آموزش مدلها و نحوه ابراز تمایل کاربران را شناسایی کرد. در طول آموزش، مدل ها از زیرنویس های غنی و متراکم یاد می گیرند. در زمان استنتاج، کاربران اغلب به جای توصیف دقیق یک صحنه، اعلانهای کوتاه و مبهم یا اشارهای به حالت یا تصویر مرجع تایپ میکنند.
برای رفع این شکاف، Krea 2 با دو سیستم عرضه می شود. اولی یک توسعه دهنده سریع است که از طریق یک خط لوله یادگیری تقویتی و تنظیم دقیق نظارت شده دو مرحله ای در بالای مدل های زبان بزرگ منبع باز آموزش داده شده است، که دستورات ساده را در جهت های بصری غنی تر بدون بازنویسی قصد کاربر ترسیم می کند. دومی یک سیستم مرجع سبک است که به کاربران امکان می دهد سبک یا حالت یک یا چند تصویر مرجع را با حداقل نشت محتوا تزریق کنند و کنترل دقیقی بر قدرت سبک و ترکیب وزنی ارائه می دهد.
این اجزا با هم، Krea 2 را به عنوان یک رسانه اکتشافی دوباره تعریف می کنند. به جای بازگرداندن یک پاسخ واحد، این مدل به گونه ای طراحی شده است که فضایی از امکانات را در معرض دید قرار دهد و به کاربران راه های عملی برای حرکت در آن با استفاده از کنترل متن و تصویر مبتنی بر متن ارائه دهد.
حفظ دانش موجودات واقعی
یک قابلیت ظریف اما مهم برای هر تولید کننده تصویر، توانایی نمایش صادقانه موجودیت ها، افراد، مکان ها و اشیاء شناخته شده است که کاربران ممکن است به سادگی با نام به آنها اشاره کنند. کرا نگران بود که روشهای نمونهگیری استاندارد ممکن است بهطور تصادفی مفاهیم نادر یا مهم را در طول بررسی دادهها حذف کنند.
برای جلوگیری از این امر، تیم رتبه صفحه را بر روی ویکیپدیای انگلیسی اجرا کرد، 90 درصد مقالههای برتر را بر اساس رتبه حفظ کرد، مفاهیمی را که نمیتوان بهطور معنیداری به تصویر کشید فیلتر کرد، و سپس پوشش را در مجموعه دادههای زیرنویس خود تأیید کرد، و تصاویری را که زیرنویسها به مفاهیم کمیاب ارجاع میدادند، اولویتبندی کردند. تیم پس از آن تأیید کرد که هیچ مفهومی در مجموعه داده اولیه به طور کامل از نمونه آموزشی نهایی حذف نشده است.
یک مرز باز رقابتی برای تصویر هوش مصنوعی
ورود Krea 2 منظره تولید تصویر با وزنهای باز شلوغ را تشدید میکند. این شرکت مدل خود را به عنوان "در میان 10 مدل برتر" در تابلوی تحلیل مصنوعی متن به تصویر و "مقام دوم در بین مدلهای آزمایشگاههای مستقل" قرار میدهد، ادعایی که اگر تحت نظارت گستردهتر جامعه باشد، K2 را به یکی از قویترین تولیدکنندگان تصویر در دسترس تبدیل میکند.
این گزارش فنی که تقریباً 12000 کلمه دارد و همه چیز را از اصول مدیریت داده تا زیرساختهای آموزشی توزیع شده به تفصیل شرح میدهد، همچنین یک هدف استراتژیک را دنبال میکند. با انتشار روش شناسی پشت یک مدل رقابتی، Krea از بررسی، بازتولید و بهبود، ارز اعتبار در جامعه تحقیقاتی باز دعوت می کند.
برای سازندگان و توسعهدهندگان، نتیجه یک مدل تصویری قادر و دارای مجوز آشکار است که محدوده خلاق را بر یک پیشفرض ایمن اولویت میدهد. با وزنههای موجود در Hugging Face و کد موجود در GitHub، Krea 2 موانع را برای هر کسی که میخواهد بسازد، تنظیم دقیق کند یا به سادگی با یک تولیدکننده تصویر پیشرفته با شرایط خاص خود آزمایش کند، کاهش میدهد.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →
