Black Forest Labs פרסמה את FLUX 3, מודל בסיס רב-מודאלי שלדעת החברה לומד במשותף מתמונות, וידאו ואודיו כדי לבנות ייצוג יחיד של העולם הפיזי. הוכרז ב-23 ביולי 2026, וזמין כעת בגישה מוקדמת, FLUX 3 מייצג סטייה ארכיטקטונית משמעותית מהגישה של מודל לפי מודאליות ששלטה בבינה מלאכותית מחוללת, יצירת תמונות ממוטטות, יצירת וידאו עם סאונד מקורי ואפילו בקרת רובוט למערכת מאוחדת אחת.
ההשקה מגיעה ברגע של התחרות מתעצמת במרחב המדיה הגנרטיבי, שבו שחקנים כולל Runway, Sora של OpenAI ו-Veo של גוגל מיהרו לייצר דגמי וידאו איכותיים ובעלי יכולת גבוהה יותר. FLUX 3 נכנס לתחרות הזו עם הנחת יסוד שונה מהותית: שדגמים נפרדים לכל סוג מדיה הם מגבלה מלאכותית. ההתקדמות שלה נבדקת כחלק מהסיקור המתמשך שלנו בתעשיית הבינה המלאכותית (https://aibuzzwire.news) של נוף המדיה היצרני.
מודל מאוחד של מציאות
בפוסט בלוג שליווה את השחרור, מעבדות היער השחור פרסמו את המניע התיאורטי לאימון מודל יחיד על פני מספר אופנים. החברה טענה ששום צורה אחת - בין אם תמונה, וידאו או אודיו - לא מספקת תיאור מלא של המציאות. כל אחד מהם הוא הקרנה של אותו עולם פיזי בסיסי, שנלכד על ידי חיישנים שונים, כל אחד מאבד מידע בתהליך.
תמונות לוכדות מבנים מרחביים בנקודת זמן מסוימת. סרטונים משחזרים את מימד הזמן וחושפים דינמיקה זמנית וחוקים פיזיים. אודיו חושף קשרים סיבתיים בין תופעות מכניות לאקוסטיקה שהראייה לבדה לא יכולה לזהות. השפה מקשרת את התפיסות הללו למטרות, הפשטות והוראות, כתבה החברה.
על ידי למידה מכל אלה בו-זמנית, האילוצים ההדדיים של המודל מספקים מידע רב יותר מכל אופנה בודדת בלבד. הצליל צריך להתאים להשפעה, התנועה צריכה לציית למסה, העתיד צריך לעקוב מהעבר. השיטות מפסיקות להיות נפרדות ומתחילות להוות עדות לגבי מציאות אחת בסיסית.
FLUX 3 הוא הדגם הראשון של החברה הבנוי כולו על עיקרון זה, אשר מעבדות היער השחור מכנה Self-Flow - גישה ליישור יעיל של ייצור והבנה מולטי-מודאליים בתוך אותה ארכיטקטורה בסיסית.
יצירת וידאו עם אודיו מקורי
היכולת הבולטת ביותר של FLUX 3 היא היכולת שלו ליצור סרטונים באורך של עד 20 שניות עם אודיו מקורי מסונכרן במעבר דור אחד. זה מבדיל אותו מרוב דגמי הווידאו הקיימים, שמייצרים קטעים שקטים שיש לשייך אותם לאודיו שנוצר בנפרד.
לדברי החברה, פלט הווידאו של FLUX 3 חזק במיוחד בלכידת הבעות פנים אנושיות, שיוך צלילים לאירועים פיזיים ותמיכה ביכולות רב לשוניות. ניתן לשלב את היכולות הללו ליצירת רצפים הנמשכים מספר דקות, כאשר הפניות חזותיות עוזרות להבטיח שהדמויות יישארו עקביות בכל הסצנות.
בהערכה אנושית ראשונית שנערכה במהלך האימון, FLUX 3 הועדף על פני Runway Gen-4.5 ב-77% מההשוואות ועל פני Luma Ray 3.2 ב-93% מההשוואות. מול מתחרים חדשים יותר, הוא הועדף על פני Grok Imagine Video בעד 69% מההשוואות, Kling v3 Pro ב-60%, ו-Seedance 2.0 ו-Gemini Omni Flash ב-52%.
החברה הזהירה כי תוצאות אלו הן ראשוניות וכי צפויים שיפורים נוספים בשלב הגישה המוקדמת.
תמונות ועיבוד טקסט
מעבר לווידאו, FLUX 3 יכול לסנתז ולערוך תמונות במגוון רחב של סגנונות, יחסי גובה-רוחב ורזולוציות. מעבדות היער השחור דיווחו על שיפורים משמעותיים לעומת גרסאות FLUX קודמות בטיפול בהנחיות מורכבות ויצירת טקסט מדויק בתוך תמונות - אתגר מתמשך עבור מודלים של תמונות.
שלב גישה מוקדמת ליכולות FLUX 3 Image ייפתח בשבועות שלאחר פרסום הסרטון, אמרה החברה.
גשר לבינה מלאכותית פיזית
אולי ההיבט הכי לא שגרתי של FLUX 3 הוא ההרחבה שלו לרובוטיקה. ההבנה העולמית של המודל משתרעת לחיזוי פעולה, הסבירה החברה, תוך שימוש בשני מסלולים לבינה מלאכותית פיזית: שילוב חיזוי פעולה מקורי ישירות לתוך FLUX 3, ושימוש בעמוד השדרה של הווידאו המאומן מראש כבסיס למודלים מיוחדים של פעולה המכוונים עדין עם נתונים מוגבלים ספציפיים למשימה.
Black Forest Labs שיתפה פעולה עם mimic robotics, שהייתה בין החברות הראשונות שקיבלו גישה מוקדמת ל-FLUX 3. יחד הם פיתחו את FLUX-mimic, מודל פעולה של וידאו המשלב את עמוד השדרה של FLUX 3 עם המומחיות של mimic בלימוד רובוטים לצורך מניפולציה מיומנת. לטענת החברה, המערכת כבר נבחנת במשימות ייצור אמיתיות באאודי.
זה מייצג התכנסות בולטת: אותה טכנולוגיה בסיסית המשמשת לייצור תוכן בידורי מיושמת לשליטה ברובוטים פיזיים בסביבות ייצור. התזה של החברה היא שבינה מלאכותית פיזית ויצירת תוכן פועלים על אותו בסיס, מכיוון ששניהם דורשים מודל שמבין איך חפצים מתחברים יחד, איך דברים זזים ואיך אירועים פיזיים מייצרים צליל.
תחרות ועמדת שוק
ההשקה מציבה את Black Forest Labs - הסטארט-אפ שבסיסו בברלין מאחורי דגמי יצירת התמונות הנפוצים של FLUX - כמתחרה שאפתנית יותר בתחום הבינה המלאכותית הגנרטיבית. בעוד שחברות כמו Runway התמקדו צר בווידאו ו-OpenAI בצ'אט בוטים של טקסט וצ'אט מולטי-מודאליים, Black Forest Labs מהמר שמודל מאוחד באמת על פני תחומים חזותיים, שמיעתיים ופיזיים יתגלה ככשיר יותר מאשר חלופות מיוחדות.
החברה אמרה שהיא כבר עובדת על הדור הבא של מודלים, במטרה לאחד חיזוי תפיסה, פעולה ושפה באותו מודל. במהלך השבועות והחודשים הקרובים, היא תפעיל יכולות נוספות שנבנו מאותה ארכיטקטורת התאמת זרימה רב-מודאלית, כל אחת לאחר שלב גישה מוקדם למשוב ובדיקות בטיחות.
FLUX 3 זמין כעת בגישה מוקדמת ליצירת וידאו, עם תמונות ויכולות נוספות שמתפרסמות בהדרגה.
הישאר לפני AI
הגישה המאוחדת של FLUX 3 לתמונות, וידאו, אודיו ורובוטיקה מסמנת שינוי בולט באופן שבו דגמי בינה מלאכותית מתוכננים. למידע נוסף על מרוץ המדיה היצרני וההתפתחויות האחרונות בתחום הבינה המלאכותית, עקוב אחר הסיקור חדשות הבינה המלאכותית שלנו.
קרא עוד חדשות AI →
