Black Forest Labs đã phát hành FLUX 3, một mô hình nền tảng đa phương thức mà công ty cho biết sẽ cùng nhau học hỏi từ hình ảnh, video và âm thanh để xây dựng một đại diện duy nhất cho thế giới vật chất. Được công bố vào ngày 23 tháng 7 năm 2026 và hiện có sẵn ở chế độ truy cập sớm, FLUX 3 thể hiện sự khởi đầu quan trọng về mặt kiến trúc so với cách tiếp cận theo từng mô hình đã thống trị AI tạo hình, thu gọn việc tạo hình ảnh, tạo video bằng âm thanh gốc và thậm chí cả điều khiển robot trong một hệ thống thống nhất.
Sự ra mắt diễn ra vào thời điểm cạnh tranh ngày càng gay gắt trong không gian truyền thông tổng quát, nơi những người chơi bao gồm Runway, Sora của OpenAI và Veo của Google đang chạy đua để tạo ra các mô hình video chất lượng cao hơn và có khả năng hoạt động tốt hơn. FLUX 3 tham gia cuộc thi này với một tiền đề khác về cơ bản: các mô hình riêng biệt cho từng loại phương tiện là một giới hạn giả tạo. Tiến trình của nó đang được theo dõi như một phần trong phạm vi đưa tin liên tục của ngành AI của chúng tôi về bối cảnh truyền thông tổng quát.
Một mô hình thực tế thống nhất
Trong một bài đăng trên blog kèm theo bản phát hành, Black Forest Labs đã đưa ra động lực lý thuyết cho việc đào tạo một mô hình duy nhất trên nhiều phương thức. Công ty lập luận rằng không có phương thức đơn lẻ nào – dù là hình ảnh, video hay âm thanh – có thể cung cấp một mô tả đầy đủ về thực tế. Mỗi cái là một hình chiếu của cùng một thế giới vật lý cơ bản, được ghi lại bởi các cảm biến khác nhau, mỗi cái sẽ mất thông tin trong quá trình này.
Hình ảnh chụp các cấu trúc không gian tại một thời điểm cụ thể. Video khôi phục chiều thời gian và tiết lộ động lực thời gian cũng như các quy luật vật lý. Âm thanh tiết lộ mối quan hệ nhân quả giữa hiện tượng cơ học và âm thanh mà chỉ thị giác không thể phát hiện được. Công ty viết rằng ngôn ngữ liên kết những nhận thức này với các mục tiêu, sự trừu tượng và hướng dẫn.
Bằng cách học hỏi đồng thời từ tất cả những điều này, các ràng buộc lẫn nhau của mô hình sẽ cung cấp nhiều thông tin hơn bất kỳ phương thức đơn lẻ nào. Âm thanh phải phù hợp với tác động, chuyển động phải tuân theo khối lượng, tương lai phải tuân theo quá khứ. Các phương thức không còn tách biệt nữa và bắt đầu trở thành bằng chứng về một thực tế cơ bản.
FLUX 3 là mô hình đầu tiên của công ty được xây dựng hoàn toàn dựa trên nguyên tắc này, mà Black Forest Labs gọi là Self-Flow — một cách tiếp cận để điều chỉnh hiệu quả việc tạo và hiểu đa phương thức trong cùng một kiến trúc cơ bản.
Tạo video với âm thanh gốc
Khả năng nổi bật nhất của FLUX 3 là khả năng tạo video có thời lượng lên tới 20 giây với âm thanh gốc được đồng bộ hóa trong một thế hệ duy nhất. Điều này giúp phân biệt nó với hầu hết các mẫu video hiện có vốn tạo ra các cảnh quay im lặng phải được ghép nối với âm thanh được tạo riêng.
Theo công ty, đầu ra video của FLUX 3 đặc biệt mạnh mẽ trong việc ghi lại nét mặt con người, liên kết âm thanh với các sự kiện vật lý và hỗ trợ khả năng đa ngôn ngữ. Những khả năng này có thể được kết hợp để tạo ra các chuỗi kéo dài vài phút, trong đó các tham chiếu trực quan giúp đảm bảo rằng các nhân vật vẫn nhất quán trong tất cả các cảnh.
Trong đánh giá sơ bộ về con người được thực hiện trong quá trình đào tạo, FLUX 3 được ưu tiên hơn Runway Gen-4.5 trong 77% so sánh và hơn Luma Ray 3.2 trong 93% so sánh. So với các đối thủ cạnh tranh mới hơn, nó được ưa thích hơn Grok Imagine Video với tới 69% so sánh, Kling v3 Pro với 60%, Seedance 2.0 và Gemini Omni Flash với 52%.
Công ty cảnh báo rằng những kết quả này chỉ là sơ bộ và dự kiến sẽ có những cải thiện hơn nữa trong giai đoạn truy cập sớm.
Hiển thị hình ảnh và văn bản
Ngoài video, FLUX 3 có thể tổng hợp và chỉnh sửa hình ảnh theo nhiều kiểu dáng, tỷ lệ khung hình và độ phân giải khác nhau. Black Forest Labs đã báo cáo những cải tiến đáng kể so với các phiên bản FLUX trước đó trong việc xử lý các lời nhắc phức tạp và tạo văn bản chính xác trong hình ảnh — một thách thức dai dẳng đối với các mô hình hình ảnh tổng quát.
Công ty cho biết giai đoạn truy cập sớm các khả năng Hình ảnh FLUX 3 sẽ mở ra trong vài tuần sau khi phát hành video.
Cầu nối với AI vật lý
Có lẽ khía cạnh độc đáo nhất của FLUX 3 là việc mở rộng sang lĩnh vực robot. Công ty giải thích, sự hiểu biết về thế giới của mô hình này mở rộng sang dự đoán hành động, thực hiện hai con đường dẫn đến AI vật lý: tích hợp dự đoán hành động gốc trực tiếp vào FLUX 3 và sử dụng đường trục video đã được huấn luyện trước làm nền tảng cho các mô hình hành động chuyên biệt được tinh chỉnh với dữ liệu dành riêng cho nhiệm vụ hạn chế.
Black Forest Labs hợp tác với robot bắt chước, một trong những công ty đầu tiên có quyền truy cập sớm vào FLUX 3. Họ cùng nhau phát triển FLUX-mimic, một mô hình hành động video kết hợp xương sống FLUX 3 với kiến thức chuyên môn của robot bắt chước trong việc học robot để thao tác khéo léo. Theo công ty, hệ thống này đã được thử nghiệm trên các nhiệm vụ sản xuất thực tế tại Audi.
Điều này thể hiện sự hội tụ đáng chú ý: công nghệ cơ bản tương tự được sử dụng để tạo ra nội dung giải trí đang được áp dụng để điều khiển robot vật lý trong môi trường sản xuất. Luận điểm của công ty là AI vật lý và hoạt động tạo nội dung chạy trên cùng một nền tảng, bởi vì cả hai đều yêu cầu một mô hình hiểu được cách các vật thể liên kết với nhau, cách mọi thứ chuyển động và cách các sự kiện vật lý tạo ra âm thanh.
Cạnh tranh và vị thế thị trường
Việc ra mắt định vị Black Forest Labs - công ty khởi nghiệp có trụ sở tại Berlin đứng đằng sau các mô hình tạo hình ảnh FLUX được sử dụng rộng rãi - là một đối thủ cạnh tranh đầy tham vọng hơn trong không gian AI tổng hợp. Trong khi các công ty như Runway tập trung hẹp vào video và OpenAI trên các chatbot văn bản và đa phương thức, Black Forest Labs đang đặt cược rằng một mô hình thực sự thống nhất trên các lĩnh vực thị giác, thính giác và vật lý sẽ chứng tỏ được khả năng cao hơn các giải pháp thay thế chuyên biệt.
Công ty cho biết họ đang nghiên cứu thế hệ mô hình tiếp theo, với mục tiêu thống nhất khả năng dự đoán nhận thức, hành động và ngôn ngữ trong cùng một mô hình. Trong những tuần và tháng tới, nó sẽ triển khai các khả năng bổ sung được xây dựng từ cùng một kiến trúc kết hợp luồng đa phương thức cơ bản, mỗi khả năng sẽ tuân theo giai đoạn truy cập sớm để phản hồi và kiểm tra độ an toàn.
FLUX 3 hiện có sẵn ở dạng truy cập sớm để tạo video, với hình ảnh và các khả năng bổ sung được triển khai dần dần.
Đi trước AI
Cách tiếp cận thống nhất của FLUX 3 đối với hình ảnh, video, âm thanh và robot đánh dấu một sự thay đổi đáng chú ý trong cách thiết kế các mô hình AI tổng hợp. Để biết thêm về cuộc đua truyền thông sáng tạo và những phát triển mới nhất về trí tuệ nhân tạo, hãy theo dõi tin tức tin nóng về AI của chúng tôi.
Đọc thêm tin tức về AI →
