צוות ה-Qwen של עליבאבא הוציא את Qwen-Image-2.1, דגם חדש בעל משקל פתוח ליצירת ועריכת תמונות, שלדברי החברה פוגע בהרבה מעל לגודלו. לפי צוות Qwen, רכיב היצירה הוויזואלי של הדגם מכיל רק 7 מיליארד פרמטרים, ובכל זאת הוא מנצח את רוב הדגמים הסגורים במדד הפנימי של Qwen עצמו - טענה שאם היא תחזיק מעמד בהערכה עצמאית, תסמן שינוי בולט באיזון בין יצירת תמונות פתוחה ליצירת תמונות קנייניות.
מודל של 7 מיליארד פרמטרים עם שאיפות דגל
הטענה הכותרתית של עליבאבא בולטת: רכיב יצירת חזותי של 7 מיליארד פרמטרים בלבד העולים על רוב הדגמים הסגורים. כדאי להדגיש את האזהרה המלווה אותה - ההשוואה מגיעה מהמדד של Qwen עצמו, ותוצאות בנצ'מרק עצמאיות עדיין ממתינות. הפרסום הטכנולוגי The Decoder, שסיקר את המהדורה, ציין את ההבחנה הזו ישירות, וקהילת הקוד הפתוח ב-Hacker News, שבה ההשקה גררה מאות הצבעות בעד תוך שעות, נמדדה באופן דומה בתגובות המוקדמות שלה.
מה שאין מחלוקת הוא יעילות המערכת. Qwen-Image-2.1 תוכנן לרוץ על חומרה צרכנית בעלת יכולת, כולל GPUs נגישים כמו NVIDIA RTX 3090. עבור יוצרים ומפתחים שצפו בדגמי תמונות חזיתיות נסחפים מאחורי ממשקי API ותשתית מרכזי נתונים, מודל שיכול ליצור ולערוך תמונות באופן מקומי בכרטיס צרכן בן שלוש שנים הוא פיתוח משמעותי בפני עצמו.
תמונות שקופות וקומפוזיציה מרובה הפניות
מעבר לאיכות הדור הגולמי, Qwen-Image-2.1 מציג יכולות שצוות Qwen אומר שהן מקוריות בדגם ולא מוברגות לאחר מכן. המושך את העין מבין אלה הוא תמיכה מקורית ב-RGBA - תמונות עם רקע שקוף - הן ביצירה והן בעריכה. משתמשים יכולים לבודד אובייקטים מהרקע שלהם או לשנות טקסט בשכבות שקופות מבלי לעבור הלוך ושוב דרך כלי נפרד להסרת רקע.
המודל גם מטפל בעד עשר תמונות התייחסות בעבודה אחת. לדברי Qwen, זה מאפשר זרימות עבודה כמו הרכבת דיוקן קבוצתי מתמונות בודדות של כל אדם, הפעלת חוויות ניסיון וירטואליות או עיצוב מחדש של חדרים על ידי שילוב של תמונות פנים מרובות כאסמכתאות.
עבור עריכות מקומיות, הצוות הטמיע בקרות מונחות אזור: משתמשים יכולים לצייר עיגולים, מסכות או סימנים מצוירים על פני אזור בתמונה כדי לציין היכן יש להחיל שינויים. זה מעמיד את הוראות העריכה בצורה ויזואלית במקום להסתמך רק על הנחיות טקסט לתיאור שינויים מרחביים.
שינויים בארכיטקטורה והסקה מהירה יותר
שיפורים בביצועים ב-Qwen-Image-2.1 מגיעים משינויים ארכיטקטוניים ומשימוש חוזר ב-KV מטמון, על פי צוות Qwen. אומרים שגישת המטמון מזרזת מסקנות באופן ניכר, במיוחד בזרימות עבודה הכוללות תמונות התייחסות מרובות, שבהן גישות קודמות יחשבו מחדש כמות משמעותית של עבודה בכל דור.
עבור משתמשים מעשיים, הסקה מהירה יותר על חומרה צרכנית מרכיבה את סיפור הנגישות: מחזורי איטרציה מהירים יותר הופכים יצירת תמונה מקומית לכדאית לעבודת ייצור אמיתית ולא לניסויים מדי פעם.
היכן ניתן להשיג את זה - ותפיסת הרישוי
Qwen-Image-2.1 זמין להורדה ב-Huging Face, GitHub ו- Model Scope, והצוות פרסם הדגמה בנושא Hugging Face למשתמשים שרוצים לנסות את הדגם לפני הורדתו.
עם זאת, יש מלכוד חשוב למשתמשים מסחריים. הדגם נשלח תחת רישיון מחקר האוסר במפורש שימוש מסחרי. עסקים שרוצים לבנות על Qwen-Image-2.1 חייבים להגיש בקשה ל-Qwen לקבלת רישיון נפרד. זה משקף את הגישה שבה נקטה עליבאבא עם כמה מהדורות קודמות של Qwen, שבהן המשקולות זמינות באופן חופשי למחקר והערכה, אך פריסות מניבות הכנסה דורשות הסדר ישיר עם החברה.
עבור יוצרים בודדים, חוקרים וחובבים, ההשפעה המעשית היא פשוטה: הורדה, הפעל באופן מקומי, ניסוי חופשי. עבור סטארט-אפים שמקווים לבנות מוצר על גבי המודל, תנאי הרישיון אומרים ששיחה עם עליבאבא תחילה.
מה זה אומר עבור המירוץ במשקל פתוח
המהדורה נוחתת בתקופה שבה מעבדות בינה מלאכותית סיניות מתחרות באגרסיביות על יעילות במשקל פתוח, ומשחררות דגמים הטוענים לאיכות קרובה לגבול בשבריר מספירת הפרמטרים ומעלות החומרה של מתחריהן הסגורים. מודל תמונה שמתיימר להתחרות במערכות סגורות תוך התאמה ל-GPU לצרכן הוא המקביל לדור החזותי לאסטרטגיה הרחבה יותר.
האם Qwen-Image-2.1 באמת מתאים למנהיגים סגורים יהיה תלוי במדדים עצמאיים, שעדיין לא פורסמו. בדיקות קהילתיות מוקדמות, הערכות צד שלישי והשוואות בפלטפורמות כמו Hugging Face יפתרו את השאלה בשבועות הקרובים. עד אז, הטענה נשארת של הצוות - אבל הדגם עצמו זמין היום לכל מי שיש לו את החומרה ואת הסקרנות לבדוק אותו.
עבור קוראים העוקבים אחר התחרות הרחבה יותר בין מערכות בינה מלאכותית פתוחות וסגורות, המהדורה היא נקודת נתונים נוספת בתחום שזז במהירות, המכוסה לצד החדשות האחרונות של AI תוך התפתחותה.
הישאר לפני AI
נוף ה-AI נע במהירות, ויצירת תמונות היא אחת הפינות התחרותיות ביותר שלו. עקבו אחרי ב-AI Buzz Wire לסיקור מתמשך של מהדורות דגמים, מדדים וההחלטות העסקיות שמאחוריהם.
קרא עוד חדשות AI →