Η Black Forest Labs κυκλοφόρησε το FLUX 3, ένα πολυτροπικό μοντέλο θεμελίωσης που η εταιρεία λέει ότι μαθαίνει από κοινού από εικόνες, βίντεο και ήχο για να δημιουργήσει μια ενιαία αναπαράσταση του φυσικού κόσμου. Ανακοινώθηκε στις 23 Ιουλίου 2026 και είναι πλέον διαθέσιμο σε πρώιμη πρόσβαση, το FLUX 3 αντιπροσωπεύει μια σημαντική αρχιτεκτονική απόκλιση από την προσέγγιση μοντέλου προς τρόπο που έχει κυριαρχήσει στη γενετική τεχνητή νοημοσύνη, τη δημιουργία καταρρέουσας εικόνας, τη δημιουργία βίντεο με εγγενή ήχο, ακόμη και τον έλεγχο ρομπότ σε ένα ενοποιημένο σύστημα.
Το λανσάρισμα έρχεται σε μια στιγμή εντεινόμενου ανταγωνισμού στον χώρο των γενετικών μέσων, όπου παίκτες όπως το Runway, το Sora του OpenAI και το Veo της Google αγωνίζονται για την παραγωγή μοντέλων βίντεο υψηλότερης ποιότητας και ικανότητας. Το FLUX 3 συμμετέχει σε αυτόν τον διαγωνισμό με μια θεμελιωδώς διαφορετική προϋπόθεση: ότι τα ξεχωριστά μοντέλα για κάθε τύπο μέσων αποτελούν τεχνητό περιορισμό. Η πρόοδός του παρακολουθείται ως μέρος της συνεχιζόμενης [βιομηχανικής κάλυψης AI] (https://aibuzzwire.news) του τοπίου των γενετικών μέσων.
Ένα Ενοποιημένο Μοντέλο Πραγματικότητας
Σε μια ανάρτηση ιστολογίου που συνόδευε την κυκλοφορία, τα εργαστήρια Black Forest παρουσίασαν τα θεωρητικά κίνητρα για την εκπαίδευση ενός μόνο μοντέλου σε πολλαπλούς τρόπους. Η εταιρεία υποστήριξε ότι κανένας τρόπος - είτε εικόνα, βίντεο ή ήχος - δεν παρέχει πλήρη περιγραφή της πραγματικότητας. Το καθένα είναι μια προβολή του ίδιου υποκείμενου φυσικού κόσμου, που συλλαμβάνεται από διαφορετικούς αισθητήρες, με τον καθένα να χάνει πληροφορίες στη διαδικασία.
Οι εικόνες αποτυπώνουν χωρικές δομές σε μια συγκεκριμένη χρονική στιγμή. Τα βίντεο αποκαθιστούν τη διάσταση του χρόνου και αποκαλύπτουν τη χρονική δυναμική και τους φυσικούς νόμους. Ο ήχος αποκαλύπτει αιτιώδεις σχέσεις μεταξύ μηχανικών φαινομένων και ακουστικής που η όραση από μόνη της δεν μπορεί να ανιχνεύσει. Η γλώσσα συνδέει αυτές τις αντιλήψεις με στόχους, αφαιρέσεις και οδηγίες, έγραψε η εταιρεία.
Μαθαίνοντας από όλα αυτά ταυτόχρονα, οι αμοιβαίοι περιορισμοί του μοντέλου παρέχουν περισσότερες πληροφορίες από οποιαδήποτε μεμονωμένη μέθοδο. Ο ήχος πρέπει να ταιριάζει με την κρούση, η κίνηση πρέπει να υπακούει στη μάζα, το μέλλον πρέπει να ακολουθεί από το παρελθόν. Οι μέθοδοι παύουν να είναι ξεχωριστές και αρχίζουν να αποτελούν στοιχεία για μια υποκείμενη πραγματικότητα.
Το FLUX 3 είναι το πρώτο μοντέλο της εταιρείας που βασίζεται εξ ολοκλήρου σε αυτήν την αρχή, την οποία η Black Forest Labs ονομάζει Self-Flow — μια προσέγγιση για την αποτελεσματική ευθυγράμμιση της πολυτροπικής παραγωγής και της κατανόησης μέσα στην ίδια υποκείμενη αρχιτεκτονική.
Δημιουργία βίντεο με εγγενή ήχο
Η πιο άμεσα εντυπωσιακή ικανότητα του FLUX 3 είναι η ικανότητά του να δημιουργεί βίντεο διάρκειας έως και 20 δευτερολέπτων με συγχρονισμένο εγγενή ήχο σε μία μόνο γενιά. Αυτό το διακρίνει από τα περισσότερα υπάρχοντα μοντέλα βίντεο, τα οποία παράγουν αθόρυβο υλικό που πρέπει να συνδυαστεί με ήχο που δημιουργείται ξεχωριστά.
Σύμφωνα με την εταιρεία, η έξοδος βίντεο του FLUX 3 είναι ιδιαίτερα ισχυρή στην καταγραφή των εκφράσεων του ανθρώπου, στη συσχέτιση ήχων με φυσικά γεγονότα και στην υποστήριξη πολυγλωσσικών δυνατοτήτων. Αυτές οι δυνατότητες μπορούν να συνδυαστούν για να δημιουργήσουν ακολουθίες διάρκειας πολλών λεπτών, όπου οι οπτικές αναφορές βοηθούν να διασφαλιστεί ότι οι χαρακτήρες παραμένουν συνεπείς σε όλες τις σκηνές.
Στην προκαταρκτική ανθρώπινη αξιολόγηση που πραγματοποιήθηκε κατά τη διάρκεια της εκπαίδευσης, το FLUX 3 προτιμήθηκε έναντι του Runway Gen-4.5 στο 77% των συγκρίσεων και έναντι του Luma Ray 3.2 στο 93% των συγκρίσεων. Από νεότερους ανταγωνιστές, προτιμήθηκε έναντι του Grok Imagine Video σε ποσοστό έως και 69% των συγκρίσεων, του Kling v3 Pro στο 60% και του Seedance 2.0 και του Gemini Omni Flash στο 52%.
Η εταιρεία προειδοποίησε ότι αυτά τα αποτελέσματα είναι προκαταρκτικά και ότι αναμένονται περαιτέρω βελτιώσεις κατά τη φάση της πρώιμης πρόσβασης.
Απόδοση εικόνων και κειμένου
Πέρα από το βίντεο, το FLUX 3 μπορεί να συνθέσει και να επεξεργαστεί εικόνες σε μεγάλη ποικιλία στυλ, αναλογιών και αναλύσεων. Τα εργαστήρια του Black Forest ανέφεραν σημαντικές βελτιώσεις σε σχέση με προηγούμενες εκδόσεις FLUX στον χειρισμό πολύπλοκων προτροπών και στη δημιουργία ακριβούς κειμένου εντός εικόνων — μια επίμονη πρόκληση για τα μοντέλα παραγωγής εικόνων.
Μια φάση πρώιμης πρόσβασης για τις δυνατότητες εικόνας FLUX 3 θα ανοίξει τις εβδομάδες μετά την κυκλοφορία του βίντεο, είπε η εταιρεία.
Μια γέφυρα για τη φυσική τεχνητή νοημοσύνη
Ίσως η πιο αντισυμβατική πτυχή του FLUX 3 είναι η επέκτασή του στη ρομποτική. Η παγκόσμια κατανόηση του μοντέλου επεκτείνεται στην πρόβλεψη ενεργειών, εξήγησε η εταιρεία, ακολουθώντας δύο τρόπους για τη φυσική τεχνητή νοημοσύνη: ενσωμάτωση εγγενούς πρόβλεψης δράσης απευθείας στο FLUX 3 και χρήση της προεκπαιδευμένης ραχοκοκαλιάς βίντεο ως βάσης για εξειδικευμένα μοντέλα δράσης με περιορισμένα δεδομένα για συγκεκριμένες εργασίες.
Η Black Forest Labs συνεργάστηκε με τη μιμητική ρομποτική, η οποία ήταν από τις πρώτες εταιρείες που απέκτησαν έγκαιρη πρόσβαση στο FLUX 3. Μαζί ανέπτυξαν το FLUX-mimic, ένα μοντέλο δράσης βίντεο που συνδυάζει τη ραχοκοκαλιά του FLUX 3 με την τεχνογνωσία του μιμητικού στην εκμάθηση ρομπότ για επιδέξιους χειρισμούς. Σύμφωνα με την εταιρεία, το σύστημα δοκιμάζεται ήδη σε πραγματικές εργασίες παραγωγής στην Audi.
Αυτό αντιπροσωπεύει μια αξιοσημείωτη σύγκλιση: η ίδια υποκείμενη τεχνολογία που χρησιμοποιείται για τη δημιουργία ψυχαγωγικού περιεχομένου εφαρμόζεται για τον έλεγχο των φυσικών ρομπότ σε περιβάλλοντα παραγωγής. Η θέση της εταιρείας είναι ότι η φυσική τεχνητή νοημοσύνη και η δημιουργία περιεχομένου λειτουργούν στην ίδια βάση, επειδή και τα δύο απαιτούν ένα μοντέλο που να κατανοεί πώς συγκρατούνται τα αντικείμενα, πώς κινούνται τα πράγματα και πώς τα φυσικά γεγονότα παράγουν ήχο.
Ανταγωνισμός και θέση στην αγορά
Η εκτόξευση τοποθετεί τα Black Forest Labs - τη startup με έδρα το Βερολίνο πίσω από τα ευρέως χρησιμοποιούμενα μοντέλα παραγωγής εικόνων FLUX - ως πιο φιλόδοξο ανταγωνιστή στον χώρο της τεχνητής νοημοσύνης. Ενώ εταιρείες όπως το Runway έχουν επικεντρωθεί στενά στο βίντεο και το OpenAI σε κείμενο και πολυτροπικά chatbots, η Black Forest Labs στοιχηματίζει ότι ένα πραγματικά ενοποιημένο μοντέλο σε οπτικούς, ακουστικούς και φυσικούς τομείς θα αποδειχθεί πιο ικανό από τις εξειδικευμένες εναλλακτικές λύσεις.
Η εταιρεία είπε ότι εργάζεται ήδη για την επόμενη γενιά μοντέλων, με στόχο να ενοποιήσει την αντίληψη, τη δράση και την πρόβλεψη γλώσσας στο ίδιο μοντέλο. Τις επόμενες εβδομάδες και μήνες, θα αναπτύξει πρόσθετες δυνατότητες που θα δημιουργηθούν από την ίδια υποκείμενη πολυτροπική αρχιτεκτονική αντιστοίχισης ροής, η καθεμία ακολουθώντας μια φάση πρώιμης πρόσβασης για ανατροφοδότηση και δοκιμές ασφάλειας.
Το FLUX 3 είναι τώρα διαθέσιμο σε πρώιμη πρόσβαση για δημιουργία βίντεο, με εικόνες και πρόσθετες δυνατότητες να κυκλοφορούν σταδιακά.
Μείνε μπροστά από την τεχνητή νοημοσύνη
Η ενοποιημένη προσέγγιση του FLUX 3 στις εικόνες, το βίντεο, τον ήχο και τη ρομποτική σηματοδοτεί μια αξιοσημείωτη αλλαγή στον τρόπο με τον οποίο σχεδιάζονται τα παραγωγικά μοντέλα τεχνητής νοημοσύνης. Για περισσότερα σχετικά με την κούρσα των γενετικών μέσων και τις πιο πρόσφατες εξελίξεις σε ό,τι αφορά την τεχνητή νοημοσύνη, ακολουθήστε την κάλυψή μας [έκτακτες ειδήσεις AI] (https://aibuzzwire.news).
Διαβάστε περισσότερα νέα AI →
