World Labs บริษัทข่าวกรองเชิงพื้นที่ซึ่งก่อตั้งโดย Fei-Fei Li ผู้บุกเบิก AI ได้เปิดตัว Atlas เมื่อวันที่ 1 กันยายน 2026 โดยอธิบายว่า Atlas เป็นโมเดลโลก "omni" ยุคถัดไป ในบล็อกโพสต์ของบริษัท ทีมงานกล่าวว่า Atlas ได้รับการฝึกอบรมตั้งแต่เริ่มต้นจนถึงดำเนินการกับข้อความ รูปภาพ วิดีโอ และ 3D ซึ่งเป็นโมเดลเดียวที่สร้างขึ้นเพื่อสร้าง สร้างใหม่ และจำลองโลก แทนที่จะเชี่ยวชาญในงานใดงานหนึ่งเหล่านั้น
การเปิดตัวครั้งนี้ถือเป็นเหตุการณ์สำคัญสำหรับวิทยานิพนธ์โมเดลโลกที่ Li ให้การสนับสนุนนับตั้งแต่ก่อตั้งบริษัท โดยกล่าวว่าขอบเขตถัดไปของ AI ไม่ใช่แค่ในภาษาเท่านั้น แต่ยังอยู่ในระบบที่เข้าใจว่าโลกปรากฏ พฤติกรรม และวิวัฒนาการอย่างไร World Labs วางกรอบเทคโนโลยีให้เป็นรากฐานในการแสดงโลกในจินตนาการสำหรับผู้ใช้ที่สร้างสรรค์ จำลองโลกแห่งความเป็นจริงด้วยความเที่ยงตรงสูง และช่วยหุ่นยนต์ในการวางแผนการดำเนินการ หากต้องการข้อมูลเพิ่มเติมเกี่ยวกับเรื่องนี้และความพยายามในการวิจัยระดับแนวหน้าอื่นๆ โปรดสำรวจ ความครอบคลุมของอุตสาหกรรม AI ของเรา
หนึ่งแบบจำลอง บริบทเชิงพื้นที่ที่ใช้ร่วมกัน
ในเชิงสถาปัตยกรรม Atlas คือสิ่งที่ World Labs เรียกว่าหม้อแปลงกระจายแบบถดถอยอัตโนมัติหลายรูปแบบ เช่นเดียวกับโมเดลภาษาขนาดใหญ่ อันดับแรกจะเข้ารหัสอินพุตลงในบริบท จากนั้นจึงสร้างเอาต์พุตที่มีเงื่อนไขตามบริบทนั้น ความแตกต่างคือเชิงพื้นที่: ภาพอินพุตแต่ละภาพวางอยู่บนตำแหน่ง 3 มิติในอวกาศ ก่อให้เกิดสิ่งที่บริษัทเรียกว่าบริบทเชิงพื้นที่ และ Atlas จะสร้างสิ่งที่จะเกิดขึ้นต่อไปในขณะที่ยังคงเป็น 3 มิติ โดยสอดคล้องกับทุกสิ่งที่ได้เห็น — จินตนาการถึงสิ่งที่อยู่นอกเหนือจากนั้น
การออกแบบดังกล่าวช่วยให้สามารถใช้งานร่วมกับเครื่องกำเนิดวิดีโอแบบเดิมๆ ได้อย่างไม่สะดวก ภาพอ้างอิงที่ไม่เกี่ยวข้องสองภาพสามารถวางลงในบริบทในตำแหน่ง 3 มิติที่แตกต่างกันได้ และ Atlas จะสร้างโลกที่สอดแทรกระหว่างภาพเหล่านั้นได้อย่างราบรื่น ประดิษฐ์ทางเข้าประตู โถงทางเดิน และการเปลี่ยนภาพที่เชื่อมโยงทั้งสองฉากเข้าด้วยกันอย่างเป็นไปได้ บริษัทยังกล่าวอีกว่าโมเดลนี้สร้างขึ้นเพื่อปรับขนาด โดยประสิทธิภาพจะดีขึ้นเมื่อการประมวลผลการฝึกอบรมเพิ่มขึ้น
การควบคุมกล้องพิกเซลที่สมบูรณ์แบบและวิดีโอแบบยาว
คุณลักษณะการสร้างกระโจมของ Atlas คือวิดีโอที่ควบคุมด้วยกล้อง โมเดลสามารถสร้างวิดีโอความยาวสูงสุดหนึ่งนาทีที่ความละเอียด 1440p ได้ตั้งแต่รูปภาพอินพุตหนึ่งถึงหกภาพ โดยเป็นไปตามเส้นทางของกล้องที่ระบุอย่างแม่นยำ World Labs เน้นย้ำว่ารูปทรงของกล้องเป็นประเภทอินพุตดั้งเดิม ซึ่งนอกเหนือไปจากข้อความแจ้งหยาบๆ ดังนั้นผู้สร้างจึงสามารถจัดเฟรมทุกช็อตและควบคุมทุกการเคลื่อนไหวได้ ในการสาธิต ทีมงานออกแบบกล้องด้วยมือผ่านฉากต่างๆ เพื่อสร้างคลิปความยาวหนึ่งนาทีที่เชื่อมโยงกัน โดยบรรยายประสบการณ์ว่า "อยู่ในเก้าอี้ผู้กำกับ" แทนที่จะดึงคันโยกของสล็อตแมชชีน
นอกจากนี้ โมเดลยังสร้างรูปภาพและภาพพาโนรามา 360 องศาจากข้อความ ด้วยความสามารถในการปฏิบัติตามข้อความแจ้งที่ซับซ้อน แสดงข้อความ และสร้างสไตล์ภาพที่หลากหลาย
การสร้างใหม่ซึ่งท้าทายโมเดลผู้เชี่ยวชาญ
ในด้านการฟื้นฟู World Labs อ้างสิทธิ์ที่ชัดเจน: Atlas สร้างฉากในโลกแห่งความเป็นจริงขึ้นมาใหม่จากรูปภาพธรรมดาเพียงไม่กี่สองหรือสามภาพ "มีประสิทธิภาพเหนือกว่าผลลัพธ์ที่ล้ำสมัยด้วยแบบจำลองที่ได้รับการฝึกฝนเป็นพิเศษสำหรับการสร้างใหม่ 3 มิติเท่านั้น" บริษัทเรียกการสังเคราะห์มุมมองแบบใหม่จากอินพุตที่กระจัดกระจายว่าเป็นปัญหาพื้นฐานที่มีมานานหลายทศวรรษในการมองเห็นคอมพิวเตอร์ 3 มิติ
Atlas ยังสามารถนำเข้าภาพอินพุตได้มากกว่าร้อยภาพเพื่อสร้างสภาพแวดล้อมจริงขึ้นมาใหม่ ในการสาธิตครั้งหนึ่ง ทีมงานได้สร้าง Main Quad ของ Stanford ขึ้นใหม่ทีละชิ้นจากภาพถ่ายระดับพื้นดินสองถึงยี่สิบห้าภาพ จากนั้นจึงสร้างเส้นทางทางอากาศที่บินสูงขึ้นไปเหนือวิทยาเขต เติมเต็มมุมมองที่ไม่มีกล้องตัวใดเคยจับภาพได้
สำหรับการใช้งานจริง Atlas ไม่ได้หยุดอยู่ที่เฟรม 2D เท่านั้น โดยธรรมชาติแล้วจะทำงานบนเฟรมภาพและแผนที่เชิงลึก 3 มิติ โดยส่งออกโลกเป็นพอยต์คลาวด์หรือ 3D Gaussian splats ที่เรนเดอร์บนอุปกรณ์ด้วยความละเอียดสูงและอัตราเฟรม นั่นคือการนำเสนอแบบเดียวกับที่ใช้ใน Marble ซึ่งเป็นผลิตภัณฑ์แรกของ World Labs ดังนั้นเอาต์พุต Atlas จึงเสียบเข้ากับไปป์ไลน์ที่มีอยู่ของบริษัทโดยตรง
จาก Bullet Time สู่การฝึกหุ่นยนต์
ความสามารถในการจำลองของ Atlas อาจมีความสำคัญมากที่สุดสำหรับวิทยาการหุ่นยนต์ บริษัทแสดงให้เห็นว่าภาพจากกล้องโทรศัพท์มือถือทั่วไปเพียงไม่กี่ตัวที่ติดตั้งขาตั้งกล้องและแคลมป์ที่พอดีกับกระเป๋าเป้สะพายหลัง เพียงพอสำหรับ Atlas ในการสร้างฉากขึ้นมาใหม่และเปิดใช้งาน "เวลากระสุน" การจัดเฟรมใหม่จากมุมที่เป็นไปไม่ได้ ไม่จำเป็นต้องใช้สตูดิโอจับภาพเฉพาะทาง
สำหรับขั้นตอนการทำงานแบบ Real-to-Sim นั้น Atlas จะสร้างพื้นที่ขึ้นมาใหม่จากวิดีโอในโทรศัพท์ขนาดสั้น จากนั้นสร้างข้อมูล RGB และความลึกที่กล้องที่ติดตั้งบนร่างกายของหุ่นยนต์จำลองจะสังเกตไปตามเส้นทาง โดยที่โลกและมุมมองของหุ่นยนต์นั้นมาจากโมเดลเดียวกัน บริษัทสาธิตการนำทางในสภาพแวดล้อมที่สแกนขนาดใหญ่โดยใช้เฟรมละ 24 เฟรม รวมถึงสถานการณ์การจัดการที่งานจำลองสามารถเปลี่ยนแปลงได้โดยการเปลี่ยนวัตถุ ตำแหน่ง และฉากเมื่อจำลองงานแล้ว
ทำไมมันถึงสำคัญ
แบบจำลองโลกถูกมองว่าเป็นส่วนเสริมของแบบจำลองภาษาขนาดใหญ่มากขึ้น: LLM ให้เหตุผลเกี่ยวกับคำอธิบายของโลก ในขณะที่แบบจำลองโลกมุ่งเป้าไปที่การสร้างแบบจำลองของโลกเอง — เรขาคณิต ฟิสิกส์ และไดนามิกของมันเมื่อเวลาผ่านไป หากคำกล่าวอ้างของ Atlas อยู่ภายใต้การตรวจสอบจากภายนอก แอปพลิเคชันจะครอบคลุม VFX การเล่นเกม การออกแบบ วิศวกรรม และการฝึกอบรมหุ่นยนต์ ซึ่งสภาพแวดล้อมสังเคราะห์แต่เป็นไปได้ทางกายภาพสามารถลดต้นทุนของเครื่องมือการสอนในการดำเนินการได้อย่างมาก
บริษัทที่อยู่เบื้องหลังโมเดลนี้มีความโดดเด่นในตัวมันเอง World Labs ก่อตั้งโดย Fei-Fei Li ศาสตราจารย์จากมหาวิทยาลัยสแตนฟอร์ดผู้สร้าง ImageNet ช่วยจุดประกายยุคการเรียนรู้เชิงลึก เคียงข้าง Justin Johnson, Ben Mildenhall และ Christoph Lassner และรายชื่อนักลงทุน ได้แก่ a16z, Nvidia, AMD, Intel, Adobe, Salesforce และ Samsung และอื่นๆ อีกมากมาย Marble ซึ่งเป็นผลิตภัณฑ์แรกของบริษัท ช่วยให้ผู้ใช้สามารถสร้างโลก 3 มิติอย่างต่อเนื่องจากรูปภาพ วิดีโอ ข้อความ และเค้าโครง 3 มิติ และ World Labs กล่าวว่า Atlas จะเพิ่มพลังให้กับเวอร์ชันในอนาคต
Atlas ยังไม่พร้อมให้บริการทั่วไป: บริษัทกำลังรับคำขอให้เข้าถึงได้ก่อนใคร อย่างไรก็ตาม การเปิดตัวครั้งนี้ถือเป็นก้าวที่เป็นรูปธรรมที่สุดก้าวหนึ่งสำหรับระบบ AI ซึ่งไม่เพียงแต่อธิบายโลกทางกายภาพเท่านั้น แต่ยังถือเป็นโมเดลที่สอดคล้องกันและปรับเปลี่ยนได้อีกด้วย
---
ก้าวนำหน้า AIรับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว
อ่านข่าว AI เพิ่มเติม →