World Labs, společnost zabývající se prostorovou inteligencí, založená průkopníkem umělé inteligence Fei-Fei Li, představila Atlas 1. září 2026 a popsala jej jako svůj model „všeho světa“ nové generace. V příspěvku na firemním blogu tým uvedl, že Atlas je od nuly připraven k nativnímu ovládání textu, obrázků, videa a 3D – jediného modelu vytvořeného tak, aby generoval, rekonstruoval a simuloval světy, spíše než aby se specializoval na některý z těchto úkolů.
Uvedení na trh je milníkem pro tezi světových modelů, kterou Li prosazuje od založení společnosti: že další hranice umělé inteligence nespočívá pouze v jazyce, ale v systémech, které rozumí tomu, jak se světy objevují, chovají a vyvíjejí. World Labs staví technologii jako základ pro vykreslování imaginárních světů pro kreativní uživatele, simulaci reálného světa ve vysoké věrnosti a pomáhá robotům plánovat akce. Další informace o tomto a dalších snahách hraničního výzkumu naleznete v našem pokrytí odvětví AI.
Jeden model, sdílený prostorový kontext
Architektonicky je Atlas tím, co World Labs nazývá multimodální autoregresivní difúzní transformátor. Stejně jako velký jazykový model nejprve zakóduje své vstupy do kontextu a poté generuje výstupy podmíněné tímto kontextem. Rozdíl je prostorový: každý vstupní obraz je založen na 3D pozici v prostoru a tvoří to, co společnost nazývá prostorovým kontextem, a Atlas generuje to, co přijde dál, přičemž zůstává 3D konzistentní se vším, co viděl – představuje si to, co leží za ním.
Tento design umožňuje funkce, které by bylo nepohodlné nasadit na konvenční video generátory. Dva nesouvisející referenční obrazy mohou být umístěny do kontextu na různých 3D pozicích a Atlas vytvoří svět, který mezi nimi hladce interpoluje, vynaleze dveře, chodby a přechody, které věrohodně přemosťují dvě scény. Společnost také uvedla, že model je vytvořen v měřítku, přičemž výkon se zlepšuje, jak se zvyšuje trénovací výpočet.
Dokonalé ovládání fotoaparátu v pixelech a dlouhé video
Funkce generování markýz Atlas je video řízené kamerou. Z jednoho až šesti vstupních snímků dokáže model generovat až jednu minutu videa v rozlišení 1440p, přičemž sleduje přesně specifikované dráhy kamery. World Labs zdůrazňuje, že geometrie kamery je nativním typem zadávání – jde nad rámec hrubých textových výzev – takže tvůrci mohou zarámovat každý záběr a ovládat každý pohyb. V ukázkách tým ručně navržený kamerou prochází scénou a vytváří souvislý minutový klip, který popisuje zážitek jako „v režisérském křesle“, spíše než jako tahání za páku automatu.
Model také generuje obrázky a 360stupňová panoramata z textu s možností sledovat složité výzvy, vykreslovat text a vytvářet různé vizuální styly.
Rekonstrukce, která je výzvou pro specializované modely
Pokud jde o rekonstrukci, World Labs tvrdí odvážné tvrzení: Atlas rekonstruuje skutečné scény z pouhých dvou nebo tří běžných obrázků, „překonává nejmodernější výsledky modelů speciálně vyškolených pouze pro 3D rekonstrukci“. Společnost nazývá syntézu nového pohledu z řídkých vstupů desetiletí starým základním problémem v 3D počítačovém vidění.
Atlas také dokáže zpracovat více než sto vstupních obrázků pro věrné zobrazení skutečných prostředí. V jedné ukázce tým přestavěl Stanford's Main Quad kus po kuse ze dvou na dvacet pět přízemních fotografií a poté vygeneroval vzdušné dráhy létající vysoko nad kampusem – vyplňovaly pohledy, které žádná kamera nikdy nezachytila.
Z hlediska praktického použití se Atlas nezastaví u 2D snímků. Nativně pracuje s obrazovými snímky a 3D hloubkovými mapami a vydává světy jako mračna bodů nebo 3D Gaussovy ikony, které vykreslují na zařízení ve vysokém rozlišení a snímkové frekvenci. To je stejné znázornění použité v Marble, prvním produktu World Labs, takže výstupy Atlas se zapojují přímo do stávajícího potrubí společnosti.
Od Bullet Time k tréninku robotů
Simulační schopnosti Atlasu mohou být pro robotiku nejdůležitější. Společnost ukázala, že záběry z pouhých tří běžných fotoaparátů mobilních telefonů – připevněných pomocí stativů a svorek, které se vejdou do batohu – stačí Atlasu k rekonstrukci scény a umožnění „bullet time“ přerámování z nemožných úhlů, není potřeba žádné specializované snímací studio.
Pro pracovní postupy Real-to-Sim Atlas rekonstruuje prostory z krátkých telefonních videí a poté generuje RGB a hloubková data, která by simulované kamery na těle robota pozorovaly podél cesty – přičemž svět a pohled robota na něj pocházejí ze stejného modelu. Společnost předvedla navigaci ve velkých naskenovaných prostředích s použitím 24 snímků v každém a navíc scénáře manipulace, kde lze simulované úlohy měnit změnou objektů, pozic a scén, jakmile je úloha simulována.
Proč na tom záleží
Světové modely jsou stále více vnímány jako doplněk velkých jazykových modelů: LLM uvažují o popisech světa, zatímco světové modely se snaží modelovat svět samotný – jeho geometrii, fyziku a dynamiku v průběhu času. Pokud tvrzení Atlasu pod externím zkoumáním obstojí, aplikace zahrnují VFX, hraní her, design, inženýrství a školení robotů, kde by syntetická, ale fyzicky věrohodná prostředí mohla dramaticky snížit náklady na výuku strojů, aby jednaly.
Společnost stojící za modelem je pozoruhodná sama o sobě. World Labs založil Fei-Fei Li – profesor ze Stanfordu, jehož vytvoření ImageNet pomohlo zažehnout éru hlubokého učení – spolu s Justinem Johnsonem, Benem Mildenhallem a Christophem Lassnerem, a jeho seznam investorů zahrnuje mimo jiné a16z, Nvidia, AMD, Intel, Adobe, Salesforce a Samsung. Marble, první produkt společnosti, umožňuje uživatelům vytvářet trvalé 3D světy z obrázků, videa, textu a 3D rozložení a World Labs uvedlo, že Atlas bude pohánět jeho budoucí verze.
Atlas zatím není obecně dostupný: společnost přijímá žádosti o předběžný přístup. Vydání přesto představuje jeden z nejkonkrétnějších kroků směrem k systémům umělé inteligence, které pouze nepopisují fyzický svět, ale obsahují jeho konzistentní, manipulovatelný model.
---
Stay Ahead of AIZískejte nejnovější zprávy o AI, analýzy a průlomy – vše na jednom místě.
Přečtěte si další zprávy o AI →