Black Forest Labs ได้เปิดตัว FLUX 3 ซึ่งเป็นโมเดลพื้นฐานหลายรูปแบบที่บริษัทกล่าวว่าได้เรียนรู้ร่วมกันจากภาพ วิดีโอ และเสียง เพื่อสร้างการนำเสนอโลกทางกายภาพเพียงหนึ่งเดียว ประกาศเมื่อวันที่ 23 กรกฎาคม พ.ศ. 2569 และขณะนี้พร้อมให้บริการในช่วงทดลองใช้ก่อนเปิดตัว FLUX 3 แสดงถึงสถาปัตยกรรมที่แตกต่างจากแนวทางแบบโมเดลต่อโมดิลิตี ซึ่งครอบงำ AI แบบกำเนิด การสร้างภาพแบบยุบ การสร้างวิดีโอด้วยเสียงแบบเนทีฟ และแม้แต่การควบคุมหุ่นยนต์ให้อยู่ในระบบที่เป็นหนึ่งเดียว

การเปิดตัวมาถึงช่วงเวลาแห่งการแข่งขันที่เข้มข้นในพื้นที่สื่อเจนเนอเรทีฟ ซึ่งผู้เล่นรวมถึง Runway, Sora ของ OpenAI และ Veo ของ Google ต่างแข่งขันกันเพื่อผลิตโมเดลวิดีโอคุณภาพสูงและมีความสามารถมากขึ้น FLUX 3 เข้าร่วมการแข่งขันนี้โดยมีหลักฐานที่แตกต่างกันโดยพื้นฐาน: การแยกรุ่นสำหรับสื่อแต่ละประเภทถือเป็นข้อจำกัดที่สร้างขึ้นเอง ความคืบหน้ากำลังได้รับการตรวจสอบโดยเป็นส่วนหนึ่งของ [การรายงานข่าวของอุตสาหกรรม AI] (https://aibuzzwire.news) ที่กำลังดำเนินอยู่เกี่ยวกับภูมิทัศน์สื่อเชิงสร้างสรรค์

แบบจำลองความเป็นจริงแบบครบวงจร

ในบล็อกโพสต์ที่มาพร้อมกับการเปิดตัว Black Forest Labs ได้วางแรงจูงใจทางทฤษฎีสำหรับการฝึกโมเดลเดียวในหลายรูปแบบ บริษัทแย้งว่าไม่มีรูปแบบเดียว ไม่ว่าจะเป็นภาพ วิดีโอ หรือเสียง ที่ให้คำอธิบายความเป็นจริงได้ครบถ้วน แต่ละภาพเป็นการฉายภาพของโลกทางกายภาพเดียวกัน ซึ่งถูกจับโดยเซ็นเซอร์ที่แตกต่างกัน โดยแต่ละภาพจะสูญเสียข้อมูลไปในกระบวนการ

รูปภาพจะบันทึกโครงสร้างเชิงพื้นที่ ณ เวลาใดเวลาหนึ่งโดยเฉพาะ วิดีโอคืนมิติของเวลาและเผยให้เห็นพลวัตทางโลกและกฎทางกายภาพ เสียงเผยให้เห็นความสัมพันธ์เชิงสาเหตุระหว่างปรากฏการณ์ทางกลและเสียงที่การมองเห็นเพียงอย่างเดียวไม่สามารถตรวจจับได้ ภาษาเชื่อมโยงการรับรู้เหล่านี้กับเป้าหมาย นามธรรม และคำแนะนำ บริษัทเขียนไว้

ด้วยการเรียนรู้จากสิ่งเหล่านี้พร้อมกัน ข้อจำกัดร่วมกันของแบบจำลองจึงให้ข้อมูลมากกว่ารูปแบบใดๆ เพียงอย่างเดียว เสียงต้องสอดคล้องกับแรงกระแทก การเคลื่อนไหวต้องเป็นไปตามมวล อนาคตต้องเป็นไปตามอดีต รังสีหยุดแยกจากกันและเริ่มเป็นหลักฐานเกี่ยวกับความเป็นจริงที่ซ่อนอยู่

FLUX 3 เป็นโมเดลแรกของบริษัทที่สร้างขึ้นบนหลักการนี้ทั้งหมด ซึ่ง Black Forest Labs เรียกว่า Self-Flow ซึ่งเป็นแนวทางสำหรับการปรับรุ่นและความเข้าใจหลายรูปแบบอย่างมีประสิทธิภาพภายในสถาปัตยกรรมพื้นฐานเดียวกัน

การสร้างวิดีโอพร้อมเสียงเนทิฟ

ความสามารถที่โดดเด่นที่สุดในทันทีของ FLUX 3 คือความสามารถในการสร้างวิดีโอที่มีความยาวสูงสุด 20 วินาทีพร้อมเสียงเนทิฟที่ซิงโครไนซ์ในเจเนอเรชั่นเดียว สิ่งนี้ทำให้วิดีโอแตกต่างจากรุ่นวิดีโอที่มีอยู่ส่วนใหญ่ ซึ่งสร้างฟุตเทจแบบไม่มีเสียงซึ่งต้องจับคู่กับเสียงที่สร้างขึ้นแยกกัน

จากข้อมูลของบริษัท เอาต์พุตวิดีโอของ FLUX 3 มีความแข็งแกร่งเป็นพิเศษในการจับภาพการแสดงออกทางสีหน้าของมนุษย์ การเชื่อมโยงเสียงกับเหตุการณ์ทางกายภาพ และรองรับความสามารถหลายภาษา ความสามารถเหล่านี้สามารถนำมารวมกันเพื่อสร้างลำดับเหตุการณ์ที่กินเวลาหลายนาที โดยที่การอ้างอิงด้วยภาพช่วยให้มั่นใจว่าตัวละครจะมีความสอดคล้องกันในทุกฉาก

ในการประเมินเบื้องต้นโดยมนุษย์ที่ดำเนินการระหว่างการฝึกอบรม FLUX 3 เป็นที่ต้องการมากกว่า Runway Gen-4.5 ใน 77% ของการเปรียบเทียบ และมากกว่า Luma Ray 3.2 ใน 93% ของการเปรียบเทียบ เมื่อเทียบกับคู่แข่งรายใหม่ ได้รับความนิยมมากกว่า Grok Imagine Video ในการเปรียบเทียบมากถึง 69%, Kling v3 Pro ใน 60% และ Seedance 2.0 และ Gemini Omni Flash ใน 52%

บริษัทเตือนว่าผลลัพธ์เหล่านี้เป็นเพียงผลเบื้องต้นและคาดว่าจะมีการปรับปรุงเพิ่มเติมในระหว่างช่วงการเข้าถึงก่อนกำหนด

การแสดงรูปภาพและข้อความ

นอกเหนือจากวิดีโอแล้ว FLUX 3 ยังสามารถสังเคราะห์และแก้ไขภาพในสไตล์ อัตราส่วนภาพ และความละเอียดที่หลากหลาย Black Forest Labs รายงานการปรับปรุงที่สำคัญกว่า FLUX เวอร์ชันก่อนหน้าในการจัดการกับข้อความแจ้งที่ซับซ้อนและสร้างข้อความที่แม่นยำภายในรูปภาพ ซึ่งเป็นความท้าทายอย่างต่อเนื่องสำหรับโมเดลรูปภาพเชิงสร้างสรรค์

ระยะการเข้าถึงเบื้องต้นสำหรับความสามารถของ FLUX 3 Image จะเปิดขึ้นในสัปดาห์หลังการเปิดตัววิดีโอ บริษัท กล่าว

สะพานสู่ AI ทางกายภาพ

บางทีลักษณะที่แหวกแนวที่สุดของ FLUX 3 ก็คือการขยายไปสู่วิทยาการหุ่นยนต์ ความเข้าใจโลกของโมเดลขยายไปสู่การทำนายการกระทำ บริษัทอธิบาย โดยใช้สองเส้นทางสู่ AI ทางกายภาพ: บูรณาการการทำนายการกระทำแบบเนทีฟโดยตรงใน FLUX 3 และใช้แกนหลักของวิดีโอที่ได้รับการฝึกไว้ล่วงหน้าเป็นรากฐานสำหรับโมเดลการดำเนินการพิเศษที่ได้รับการปรับแต่งอย่างละเอียดด้วยข้อมูลเฉพาะงานที่มีจำกัด

Black Forest Labs ร่วมมือกับหุ่นยนต์เลียนแบบ ซึ่งเป็นหนึ่งในบริษัทแรกๆ ที่ได้รับสิทธิ์เข้าถึง FLUX 3 ก่อนใคร พวกเขาร่วมกันพัฒนา FLUX-mimic ซึ่งเป็นโมเดลการกระทำผ่านวิดีโอที่ผสมผสานกระดูกสันหลังของ FLUX 3 เข้ากับความเชี่ยวชาญของเลียนแบบในการเรียนรู้หุ่นยนต์เพื่อการยักย้ายที่คล่องแคล่ว จากข้อมูลของบริษัท ระบบดังกล่าวได้รับการทดสอบกับงานการผลิตจริงที่ Audi แล้ว

สิ่งนี้แสดงให้เห็นถึงการบรรจบกันที่โดดเด่น: มีการใช้เทคโนโลยีพื้นฐานแบบเดียวกับที่ใช้ในการสร้างเนื้อหาความบันเทิงเพื่อควบคุมหุ่นยนต์ทางกายภาพในสภาพแวดล้อมการผลิต วิทยานิพนธ์ของบริษัทคือ AI ทางกายภาพและการสร้างเนื้อหาทำงานบนรากฐานเดียวกัน เนื่องจากทั้งสองต้องการแบบจำลองที่เข้าใจว่าวัตถุต่างๆ เชื่อมโยงกันอย่างไร สิ่งต่างๆ เคลื่อนไหวอย่างไร และเหตุการณ์ทางกายภาพสร้างเสียงได้อย่างไร

การแข่งขันและตำแหน่งทางการตลาด

การเปิดตัวครั้งนี้ทำให้ Black Forest Labs ซึ่งเป็นสตาร์ทอัพในเบอร์ลินที่อยู่เบื้องหลังโมเดลการสร้างภาพ FLUX ที่ใช้กันอย่างแพร่หลาย กลายเป็นคู่แข่งที่ทะเยอทะยานมากขึ้นในพื้นที่ generative AI ในขณะที่บริษัทอย่าง Runway มุ่งเน้นไปที่วิดีโอและ OpenAI ในข้อความและแชทบอทหลายรูปแบบ Black Forest Labs เดิมพันว่าโมเดลที่เป็นหนึ่งเดียวอย่างแท้จริงทั้งโดเมนภาพ การได้ยิน และทางกายภาพจะพิสูจน์ได้ว่ามีความสามารถมากกว่าทางเลือกเฉพาะทาง

บริษัทกล่าวว่ากำลังดำเนินการกับโมเดลเจเนอเรชันถัดไป โดยมีเป้าหมายในการรวมการรับรู้ การกระทำ และการทำนายภาษาไว้ในโมเดลเดียวกัน ในอีกไม่กี่สัปดาห์และเดือนข้างหน้า จะมีการเปิดตัวความสามารถเพิ่มเติมที่สร้างขึ้นจากสถาปัตยกรรมการจับคู่โฟลว์หลายรูปแบบเดียวกัน โดยแต่ละรายการจะเป็นไปตามระยะการเข้าถึงล่วงหน้าสำหรับการทดสอบความคิดเห็นและความปลอดภัย

FLUX 3 พร้อมให้ใช้งานแล้วในช่วงทดลองใช้ก่อนเปิดตัวสำหรับการสร้างวิดีโอ โดยจะมีรูปภาพและความสามารถเพิ่มเติมเพิ่มมากขึ้นเรื่อยๆ

ก้าวนำหน้า AI

แนวทางที่เป็นหนึ่งเดียวของ FLUX 3 ในด้านรูปภาพ วิดีโอ เสียง และหุ่นยนต์ ถือเป็นการเปลี่ยนแปลงที่โดดเด่นในการออกแบบโมเดล AI เชิงสร้างสรรค์ หากต้องการข้อมูลเพิ่มเติมเกี่ยวกับการแข่งขันด้านสื่อเจนเนอเรทีฟและการพัฒนาล่าสุดในด้านปัญญาประดิษฐ์ โปรดติดตามการรายงานข่าว ข่าว AI ด่วน ของเรา

อ่านข่าว AI เพิ่มเติม →