World Labs, det rumsliga intelligensföretaget som grundades av AI-pionjären Fei-Fei Li, introducerade Atlas den 1 september 2026 och beskrev det som nästa generations "omni" världsmodell. I ett företagsblogginlägg sa teamet att Atlas är förtränad från grunden för att inbyggt arbeta med text, bilder, video och 3D - en enda modell byggd för att generera, rekonstruera och simulera världar snarare än att specialisera sig på någon av dessa uppgifter.
Lanseringen är en milstolpe för avhandlingen om världsmodeller som Li har kämpat för sedan han grundade företaget: att nästa gräns för AI ligger inte bara i språket, utan i system som förstår hur världar ser ut, beter sig och utvecklas. World Labs ramar in tekniken som grunden för att rendera föreställda världar för kreativa användare, simulera den verkliga världen i hög trohet och hjälpa robotar att planera åtgärder. För mer information om detta och andra spetsforskningsinsatser, utforska vår AI-industritäckning.
En modell, en delad rumslig kontext
Arkitektoniskt är Atlas vad World Labs kallar en multimodal autoregressiv diffusionstransformator. Liksom en stor språkmodell kodar den först sina indata i ett sammanhang och genererar sedan utdata beroende på det sammanhanget. Skillnaden är rumslig: varje ingångsbild är jordad i en 3D-position i rymden, och bildar vad företaget kallar ett rumsligt sammanhang, och Atlas genererar det som kommer härnäst samtidigt som det förblir 3D-konsekvent med allt det har sett – föreställande vad som ligger bortom det.
Den designen möjliggör funktioner som skulle vara besvärliga att fästa på konventionella videogeneratorer. Två orelaterade referensbilder kan placeras in i sammanhanget vid olika 3D-positioner, och Atlas kommer att generera en värld som smidigt interpolerar mellan dem och uppfinner dörröppningar, korridorer och övergångar som på ett rimligt sätt överbryggar de två scenerna. Företaget sa också att modellen är byggd för att skala, med prestanda som förbättras när träningsberäkningen ökar.
Pixel-perfekt kamerakontroll och långformatsvideo
Atlas tältgenereringsfunktion är kamerastyrd video. Från en till sex ingångsbilder kan modellen generera upp till en minuts video med en upplösning på 1440p, efter exakt specificerade kameravägar. World Labs betonar att kamerageometri är en inbyggd inmatningstyp – som går längre än grova textmeddelanden – så skapare kan rama in varje bild och kontrollera varje rörelse. I demos, teamet handdesignade kamerabanor genom en scen för att producera ett sammanhängande klipp på en minut, som beskriver upplevelsen som att vara "i regissörsstolen" snarare än att dra i spaken på en spelautomat.
Modellen genererar också bilder och 360-graders panoramabilder från text, med förmågan att följa komplexa uppmaningar, rendera text och producera en mängd olika visuella stilar.
Rekonstruktion som utmanar specialistmodeller
På rekonstruktionssidan gör World Labs ett djärvt påstående: Atlas rekonstruerar verkliga scener från så få som två eller tre vanliga bilder, "överträffar toppmoderna resultat av modeller som är speciellt utbildade enbart för 3D-rekonstruktion." Företaget kallar novel view-synthesis from glesa inputs för ett decennier gammalt grundläggande problem i 3D-datorseende.
Atlas kan också mata in mer än hundra ingångsbilder för trogen återskapande av verkliga miljöer. I en demonstration byggde teamet om Stanfords Main Quad bit för bit från två till tjugofem bilder på marknivå, och genererade sedan flygvägar som flög högt över campus – fyllde i vyer som ingen kamera någonsin fångat.
Kritiskt för praktiskt bruk stannar Atlas inte vid 2D-ramar. Den fungerar naturligt på bildramar och 3D-djupkartor, och matar ut världar som punktmoln eller 3D Gauss-symboler som återger enheten med hög upplösning och bildhastighet. Det är samma representation som används i Marble, World Labs första produkt, så Atlas-utgångar kopplas direkt till företagets befintliga pipeline.
Från Bullet Time till Robot Training
Atlas simuleringsmöjligheter kan ha störst betydelse för robotik. Företaget visade att filmer från så få som tre vanliga mobilkameror – monterade med stativ och klämmor som passar i en ryggsäck – räcker för att Atlas ska kunna rekonstruera en scen och möjliggöra "bullet time"-framställning från omöjliga vinklar, ingen specialiserad inspelningsstudio krävs.
För Real-to-Sim-arbetsflöden rekonstruerar Atlas utrymmen från korta telefonvideor och genererar sedan RGB- och djupdata som en simulerad robots kroppsmonterade kameror skulle observera längs en väg – med världen och robotens syn på den från samma modell. Företaget demonstrerade navigering över stora skannade miljöer med 24 bildrutor vardera, plus manipulationsscenarier där simulerade uppgifter kan varieras genom att ändra objekt, positioner och scener när en uppgift har simulerats.
Varför det är viktigt
Världsmodeller ses alltmer som ett komplement till stora språkmodeller: LLM:er resonerar kring beskrivningar av världen, medan världsmodeller syftar till att modellera själva världen - dess geometri, fysik och dynamik över tid. Om Atlas påståenden håller sig under extern granskning, omfattar applikationer VFX, spel, design, ingenjörskonst och robotträning, där syntetiska men fysiskt rimliga miljöer dramatiskt kan minska kostnaderna för att lära maskiner att agera.
Företaget bakom modellen är anmärkningsvärt i sin egen rätt. World Labs grundades av Fei-Fei Li - Stanford-professorn vars skapande av ImageNet hjälpte till att tända den djupa inlärningseran - tillsammans med Justin Johnson, Ben Mildenhall och Christoph Lassner, och dess investerarlista inkluderar bland annat a16z, Nvidia, AMD, Intel, Adobe, Salesforce och Samsung. Marble, företagets första produkt, låter användare skapa beständiga 3D-världar från bilder, video, text och 3D-layouter, och World Labs sa att Atlas kommer att driva framtida versioner av den.
Atlas är ännu inte allmänt tillgänglig: företaget tar emot förfrågningar om tidig åtkomst. Ändå markerar releasen ett av de mest konkreta stegen hittills mot AI-system som inte bara beskriver den fysiska världen, utan har en konsekvent, manipulerbar modell av den.
---
Stay ahead of AIFå de senaste AI-nyheterna, analyserna och genombrotten – allt på ett ställe.
Läs mer AI-nyheter →