World Labs, het ruimtelijke-intelligentiebedrijf opgericht door AI-pionier Fei-Fei Li, introduceerde Atlas op 1 september 2026 en omschreef het als zijn ‘omni’-wereldmodel van de volgende generatie. In een blogpost van het bedrijf zei het team dat Atlas van begin af aan is voorgetraind om native te werken met tekst, afbeeldingen, video en 3D – een enkel model dat is gebouwd om werelden te genereren, reconstrueren en simuleren in plaats van zich te specialiseren in een van deze taken.
De lancering is een mijlpaal voor de thesis over wereldmodellen die Li sinds de oprichting van het bedrijf verdedigt: dat de volgende grens van AI niet alleen in de taal ligt, maar in systemen die begrijpen hoe werelden verschijnen, zich gedragen en evolueren. World Labs beschouwt de technologie als de basis voor het weergeven van ingebeelde werelden voor creatieve gebruikers, het simuleren van de echte wereld in high-fidelity en het helpen van robots bij het plannen van acties. Voor meer informatie over dit en andere grensverleggende onderzoeksinspanningen kunt u onze dekking van de AI-industrie raadplegen.
Eén model, een gedeelde ruimtelijke context
Architectonisch gezien is Atlas wat World Labs een multimodale autoregressieve diffusietransformator noemt. Net als een groot taalmodel codeert het eerst zijn invoer in een context en genereert het vervolgens uitvoer die afhankelijk is van die context. Het verschil is ruimtelijk: elk invoerbeeld is gebaseerd op een 3D-positie in de ruimte en vormt wat het bedrijf een ruimtelijke context noemt, en Atlas genereert wat daarna komt, terwijl het 3D-consistent blijft met alles wat het heeft gezien – en zich voorstelt wat daarachter ligt.
Dat ontwerp maakt mogelijkheden mogelijk die lastig te koppelen zijn aan conventionele videogeneratoren. Twee niet-gerelateerde referentiebeelden kunnen op verschillende 3D-posities in de context worden geplaatst, en Atlas zal een wereld genereren die er soepel tussen interpoleert, door deuropeningen, gangen en overgangen uit te vinden die de twee scènes op plausibele wijze overbruggen. Het bedrijf zei ook dat het model op schaal is gebouwd, waarbij de prestaties verbeteren naarmate de trainingscomputer toeneemt.
Pixel-perfecte camerabediening en lange video
De selectiefunctie van Atlas is cameragestuurde video. Van één tot zes invoerbeelden kan het model maximaal één minuut video genereren met een resolutie van 1440p, waarbij nauwkeurig gespecificeerde camerapaden worden gevolgd. World Labs benadrukt dat camerageometrie een eigen invoertype is – dat verder gaat dan grove tekstaanwijzingen – zodat videomakers elke opname kunnen kadreren en elke beweging kunnen controleren. In demo's baant het team een met de hand ontworpen camera door een scène om een samenhangend fragment van één minuut te produceren, waarin de ervaring wordt beschreven als "in de stoel van de regisseur" in plaats van aan de hendel van een gokautomaat te trekken.
Het model genereert ook afbeeldingen en 360-gradenpanorama's uit tekst, met de mogelijkheid om complexe aanwijzingen te volgen, tekst weer te geven en een verscheidenheid aan visuele stijlen te produceren.
Wederopbouw die specialistische modellen uitdaagt
Wat de reconstructie betreft, doet World Labs een stoutmoedige bewering: Atlas reconstrueert taferelen uit de echte wereld op basis van slechts twee of drie gewone afbeeldingen, "en presteert beter dan de modernste resultaten met modellen die speciaal zijn getraind voor 3D-reconstructie." Het bedrijf noemt nieuwe weergavesynthese op basis van schaarse input een decennia-oud fundamenteel probleem in 3D-computervisie.
Atlas kan ook meer dan honderd invoerafbeeldingen verwerken voor een getrouwe weergave van echte omgevingen. In één demonstratie herbouwde het team de Main Quad van Stanford stukje bij beetje van twee tot vijfentwintig foto's op grondniveau, en genereerde vervolgens luchtpaden die hoog boven de campus vlogen - beelden invulden die geen enkele camera ooit had vastgelegd.
Cruciaal voor praktisch gebruik is dat Atlas niet stopt bij 2D-frames. Het werkt native op beeldframes en 3D-dieptekaarten, waarbij werelden worden weergegeven als puntenwolken of 3D Gaussiaanse splats die op het apparaat worden weergegeven met hoge resolutie en framesnelheden. Dat is dezelfde representatie die wordt gebruikt in Marble, het eerste product van World Labs, zodat de producten van Atlas rechtstreeks in de bestaande pijplijn van het bedrijf kunnen worden aangesloten.
Van Bullet Time tot robottraining
De simulatiemogelijkheden van Atlas zijn misschien wel het belangrijkst voor robotica. Het bedrijf toonde aan dat beelden van slechts drie gewone mobiele telefooncamera's – gemonteerd met statieven en klemmen die in een rugzak passen – voor Atlas genoeg zijn om een scène te reconstrueren en 'bullet time'-herkadering vanuit onmogelijke hoeken mogelijk te maken, zonder dat er een gespecialiseerde opnamestudio nodig is.
Voor Real-to-Sim-workflows reconstrueert Atlas ruimtes uit korte telefoonvideo's en genereert vervolgens de RGB- en dieptegegevens die de op het lichaam gemonteerde camera's van een gesimuleerde robot langs een pad zouden waarnemen - waarbij de wereld en het beeld van de robot daarop afkomstig zijn van hetzelfde model. Het bedrijf demonstreerde navigatie door grote gescande omgevingen met elk 24 frames, plus manipulatiescenario's waarbij gesimuleerde taken kunnen worden gevarieerd door objecten, posities en scènes te veranderen zodra een taak is gesimuleerd.
Waarom het ertoe doet
Wereldmodellen worden steeds meer gezien als een aanvulling op grote taalmodellen: LLM's redeneren over beschrijvingen van de wereld, terwijl wereldmodellen ernaar streven de wereld zelf te modelleren - de geometrie, fysica en dynamiek ervan in de loop van de tijd. Als de beweringen van Atlas standhouden onder extern toezicht, omvatten de toepassingen VFX, gaming, ontwerp, engineering en robottraining, waarbij synthetische maar fysiek plausibele omgevingen de kosten van het leren van machines dramatisch zouden kunnen verlagen.
Het bedrijf achter het model is op zichzelf al opmerkelijk. World Labs is opgericht door Fei-Fei Li – de Stanford-professor wiens creatie van ImageNet heeft bijgedragen aan het aanwakkeren van het deep learning-tijdperk – naast Justin Johnson, Ben Mildenhall en Christoph Lassner, en de lijst met investeerders omvat onder meer a16z, Nvidia, AMD, Intel, Adobe, Salesforce en Samsung. Marble, het eerste product van het bedrijf, stelt gebruikers in staat persistente 3D-werelden te creëren op basis van afbeeldingen, video, tekst en 3D-lay-outs, en World Labs zei dat Atlas toekomstige versies ervan zal aandrijven.
Atlas is nog niet algemeen beschikbaar: het bedrijf neemt verzoeken om vroege toegang aan. Toch markeert de release een van de meest concrete stappen tot nu toe in de richting van AI-systemen die niet alleen de fysieke wereld beschrijven, maar er een consistent, manipuleerbaar model van bevatten.
---
Blijf AI een stap voorOntvang het laatste AI-nieuws, analyses en doorbraken – allemaal op één plek.
Lees meer AI-nieuws →