AI प्रणेते Fei-Fei Li ने स्थापन केलेली अवकाशीय बुद्धिमत्ता कंपनी, World Labs ने 1 सप्टेंबर 2026 रोजी Atlas ला सादर केले आणि त्याचे पुढील पिढीचे "omni" जागतिक मॉडेल म्हणून वर्णन केले. कंपनीच्या ब्लॉग पोस्टमध्ये, टीमने म्हटले आहे की Atlas हे मजकूर, प्रतिमा, व्हिडिओ आणि 3D वर मूळपणे ऑपरेट करण्यासाठी सुरवातीपासून प्रशिक्षित आहे - यापैकी कोणत्याही एका कामात विशेषज्ञ होण्याऐवजी जग निर्माण करण्यासाठी, पुनर्रचना करण्यासाठी आणि सिम्युलेट करण्यासाठी तयार केलेले एकच मॉडेल.

कंपनीच्या स्थापनेपासून लीने चॅम्पियन केलेल्या जागतिक मॉडेल थीसिससाठी हा लॉन्च हा एक मैलाचा दगड आहे: AI ची पुढील सीमा केवळ भाषेत नाही, तर जग कसे दिसतात, वागतात आणि विकसित होतात हे समजणाऱ्या प्रणालींमध्ये आहे. वर्ल्ड लॅब्स सर्जनशील वापरकर्त्यांसाठी कल्पित जग प्रस्तुत करण्यासाठी, उच्च निष्ठेने वास्तविक जगाचे अनुकरण करण्यासाठी आणि यंत्रमानवांना कृतींची योजना आखण्यात मदत करण्यासाठी तंत्रज्ञानाचा पाया म्हणून फ्रेम करते. याविषयी आणि इतर सीमावर्ती संशोधन प्रयत्नांबद्दल अधिक माहितीसाठी, आमचे AI उद्योग कव्हरेज एक्सप्लोर करा.

एक मॉडेल, एक सामायिक स्थानिक संदर्भ

आर्किटेक्चरलदृष्ट्या, ॲटलसला वर्ल्ड लॅब्स मल्टीमॉडल ऑटोरेग्रेसिव्ह डिफ्यूजन ट्रान्सफॉर्मर म्हणतात. मोठ्या भाषेच्या मॉडेलप्रमाणे, ते प्रथम त्याचे इनपुट्स एका संदर्भामध्ये एन्कोड करते आणि नंतर त्या संदर्भावर कंडिशन केलेले आउटपुट तयार करते. फरक अवकाशीय आहे: प्रत्येक इनपुट प्रतिमा अंतराळातील 3D स्थितीवर आधारलेली असते, ज्याला कंपनी अवकाशीय संदर्भ म्हणतो आणि ॲटलस पुढे काय घडते ते निर्माण करते आणि 3D-तिने पाहिलेल्या प्रत्येक गोष्टीशी सुसंगत राहून - त्यापलीकडे काय आहे याची कल्पना करणे.

ते डिझाइन अशा क्षमतांना सक्षम करते ज्या पारंपारिक व्हिडिओ जनरेटरवर बोल्ट करण्यासाठी अस्ताव्यस्त असतील. दोन असंबंधित संदर्भ प्रतिमा वेगवेगळ्या 3D पोझिशन्सवर संदर्भामध्ये ठेवल्या जाऊ शकतात आणि ॲटलस एक जग निर्माण करेल जे त्यांच्यामध्ये सहजतेने इंटरपोलेट्स करेल, दरवाजा, हॉलवे आणि संक्रमणे शोधून काढेल जे दोन दृश्यांना शक्यतो पूल करेल. कंपनीने असेही म्हटले आहे की हे मॉडेल मोजमाप करण्यासाठी तयार केले आहे, प्रशिक्षण गणना वाढते म्हणून कामगिरी सुधारते.

पिक्सेल-परफेक्ट कॅमेरा कंट्रोल आणि लाँग-फॉर्म व्हिडिओ

ॲटलसचे मार्की जनरेशन वैशिष्ट्य म्हणजे कॅमेरा-नियंत्रित व्हिडिओ. एक ते सहा इनपुट प्रतिमांपर्यंत, मॉडेल अचूकपणे निर्दिष्ट कॅमेरा मार्गांचे अनुसरण करून, 1440p रिझोल्यूशनवर एक मिनिटापर्यंत व्हिडिओ तयार करू शकते. वर्ल्ड लॅब्स जोर देते की कॅमेरा भूमिती हा मूळ इनपुट प्रकार आहे — खडबडीत मजकूर प्रॉम्प्टच्या पलीकडे जाऊन — त्यामुळे निर्माते प्रत्येक शॉट फ्रेम करू शकतात आणि प्रत्येक गती नियंत्रित करू शकतात. डेमोमध्ये, स्लॉट मशीनचा लीव्हर खेचण्याऐवजी "दिग्दर्शकाच्या खुर्चीवर" असण्याचा अनुभव वर्णन करून सुसंगत एक मिनिटाची क्लिप तयार करण्यासाठी टीमने दृश्याद्वारे कॅमेरा मार्ग तयार केला.

मॉडेल जटिल प्रॉम्प्ट्स फॉलो करण्याची, मजकूर रेंडर करण्याची आणि विविध व्हिज्युअल शैली तयार करण्याच्या क्षमतेसह, मजकूरातून प्रतिमा आणि 360-डिग्री पॅनोरामा देखील व्युत्पन्न करते.

विशेषज्ञ मॉडेलना आव्हान देणारी पुनर्रचना

पुनर्बांधणीच्या बाजूने, वर्ल्ड लॅब्स एक धाडसी दावा करते: ॲटलस दोन किंवा तीन सामान्य प्रतिमांमधून वास्तविक-जगातील दृश्यांची पुनर्रचना करते, "केवळ 3D पुनर्रचनासाठी विशेष प्रशिक्षित मॉडेल्सद्वारे अत्याधुनिक परिणामांची उत्कृष्ट कामगिरी." कंपनी विरळ इनपुट्समधून नॉव्हेल व्ह्यू सिंथेसिसला 3D कॉम्प्युटर व्हिजनमधील दशके जुनी मूलभूत समस्या म्हणते.

वास्तविक वातावरणाच्या विश्वासू मनोरंजनासाठी ॲटलस शंभरहून अधिक इनपुट प्रतिमा देखील घेऊ शकतात. एका प्रात्यक्षिकात, टीमने दोन ते पंचवीस ग्राउंड-लेव्हल फोटोंमधून स्टॅनफोर्डचा मुख्य क्वाड तुकडा तुकड्याने पुन्हा तयार केला, त्यानंतर कॅम्पसच्या वर उडणारे हवाई मार्ग तयार केले - कधीही कॅमेऱ्याने कॅप्चर केलेली दृश्ये भरून.

व्यावहारिक वापरासाठी गंभीरपणे, ॲटलस 2D फ्रेमवर थांबत नाही. हे मूळतः इमेज फ्रेम्स आणि 3D डेप्थ मॅपवर चालते, पॉइंट क्लाउड्स किंवा 3D गॉसियन स्प्लॅट्स म्हणून जगाला आउटपुट करते जे उच्च रिझोल्यूशन आणि फ्रेम दरांवर डिव्हाइसवर रेंडर करते. मार्बल, वर्ल्ड लॅब्सच्या पहिल्या उत्पादनामध्ये तेच प्रतिनिधित्व वापरले जाते, त्यामुळे ॲटलस आउटपुट थेट कंपनीच्या विद्यमान पाइपलाइनमध्ये प्लग करतात.

बुलेट टाईम पासून रोबोट ट्रेनिंग पर्यंत

ॲटलसची सिम्युलेशन क्षमता रोबोटिक्ससाठी सर्वात महत्त्वाची असू शकते. कंपनीने असे दाखवले की तीन सामान्य सेल-फोन कॅमेऱ्यांचे फुटेज — बॅकपॅकमध्ये बसणारे ट्रायपॉड आणि क्लॅम्प्ससह बसवलेले — एटलसला दृश्याची पुनर्रचना करण्यासाठी आणि अशक्य कोनातून "बुलेट टाइम" रिफ्रेम करण्यास सक्षम करण्यासाठी पुरेसे आहे, विशेष कॅप्चर स्टुडिओची आवश्यकता नाही.

रिअल-टू-सिम वर्कफ्लोसाठी, ॲटलस लहान फोन व्हिडिओंमधून जागा पुनर्रचना करतो आणि नंतर RGB आणि खोलीचा डेटा तयार करतो सिम्युलेटेड रोबोटचे बॉडी-माउंट केलेले कॅमेरे मार्गावर निरीक्षण करतील — जग आणि रोबोटचे ते दृश्य त्याच मॉडेलमधून येत आहे. कंपनीने प्रत्येकी 24 फ्रेम्स वापरून मोठ्या स्कॅन केलेल्या वातावरणात नेव्हिगेशनचे प्रात्यक्षिक केले, तसेच मॅनिप्युलेशन परिदृश्ये जेथे सिम्युलेटेड कार्ये बदलून वस्तू, पोझिशन्स आणि दृश्ये बदलून बदलता येतात.

हे महत्त्वाचे का आहे

जागतिक मॉडेल्सकडे मोठ्या भाषेच्या मॉडेल्सचे पूरक म्हणून पाहिले जात आहे: LLMs जगाच्या वर्णनाबद्दल कारणे सांगतात, तर जागतिक मॉडेल्स हे जगाचे स्वतःचे मॉडेल बनवण्याचे उद्दिष्ट ठेवतात - कालांतराने त्याची भूमिती, भौतिकशास्त्र आणि गतिशीलता. जर ऍटलसचे दावे बाह्य तपासणीत टिकून राहिल्यास, अनुप्रयोगांमध्ये VFX, गेमिंग, डिझाइन, अभियांत्रिकी आणि रोबोट प्रशिक्षणाचा विस्तार आहे, जेथे कृत्रिम परंतु शारीरिकदृष्ट्या प्रशंसनीय वातावरणामुळे कृती करण्यासाठी शिकवण्याच्या मशीनच्या खर्चात नाटकीयपणे कपात होऊ शकते.

मॉडेलच्या मागे असलेली कंपनी स्वतःच उल्लेखनीय आहे. वर्ल्ड लॅब्सची स्थापना Fei-Fei Li यांनी केली - स्टॅनफोर्ड प्रोफेसर ज्यांच्या इमेजनेटच्या निर्मितीने जस्टिन जॉन्सन, बेन मिल्डनहॉल आणि क्रिस्टोफ लॅस्नर यांच्या बरोबरीने सखोल शिक्षण युगाला प्रज्वलित करण्यात मदत केली आणि तिच्या गुंतवणूकदारांच्या यादीमध्ये a16z, Nvidia, AMD, Intel, Adobe, Salesforce आणि Samsung यांचा समावेश आहे. मार्बल, कंपनीचे पहिले उत्पादन, वापरकर्त्यांना प्रतिमा, व्हिडिओ, मजकूर आणि 3D लेआउट्समधून सतत 3D जग तयार करू देते आणि वर्ल्ड लॅब्सने सांगितले की ॲटलस त्याच्या भविष्यातील आवृत्त्यांना सक्षम करेल.

Atlas अद्याप सामान्यतः उपलब्ध नाही: कंपनी लवकर प्रवेशासाठी विनंत्या घेत आहे. तरीही, प्रकाशन हे एआय सिस्टम्सच्या दिशेने सर्वात ठोस पाऊलांपैकी एक आहे जे केवळ भौतिक जगाचे वर्णन करत नाही, परंतु त्याचे एक सुसंगत, हाताळण्यायोग्य मॉडेल धारण करते.

---

एआयच्या पुढे राहा

नवीनतम AI बातम्या, विश्लेषण आणि यश मिळवा — सर्व एकाच ठिकाणी.

अधिक AI बातम्या वाचा →