World Labs, firma zajmująca się wywiadem przestrzennym założona przez pioniera sztucznej inteligencji Fei-Fei Li, wprowadziła Atlas 1 września 2026 r., opisując go jako „omni” model świata nowej generacji. W poście na firmowym blogu zespół stwierdził, że Atlas został od podstaw przeszkolony do natywnego operowania na tekście, obrazach, wideo i 3D – jest to pojedynczy model zbudowany w celu generowania, rekonstruowania i symulowania światów, a nie specjalizowania się w którymkolwiek z tych zadań.
Wprowadzenie na rynek stanowi kamień milowy w realizacji tezy modeli świata, której Li broni od chwili założenia firmy: że kolejna granica sztucznej inteligencji leży nie tylko w języku, ale w systemach, które rozumieją, jak światy wyglądają, zachowują się i ewoluują. World Labs postrzega tę technologię jako podstawę do renderowania wyimaginowanych światów dla kreatywnych użytkowników, symulowania świata rzeczywistego w wysokiej wierności i pomagania robotom w planowaniu działań. Więcej informacji na temat tych i innych pionierskich badań znajdziesz w naszym informacjach o branży AI.
Jeden model, wspólny kontekst przestrzenny
Architektonicznie Atlas jest tym, co World Labs nazywa multimodalnym autoregresyjnym transformatorem dyfuzyjnym. Podobnie jak duży model językowy, najpierw koduje dane wejściowe w kontekście, a następnie generuje dane wyjściowe uzależnione od tego kontekstu. Różnica jest przestrzenna: każdy obraz wejściowy jest osadzany w pozycji 3D w przestrzeni, tworząc to, co firma nazywa kontekstem przestrzennym, a Atlas generuje to, co będzie dalej, zachowując spójność 3D ze wszystkim, co zobaczył – wyobrażając sobie, co leży poza nim.
Taka konstrukcja zapewnia możliwości, które byłyby niewygodne w przypadku konwencjonalnych generatorów wideo. Dwa niezwiązane ze sobą obrazy referencyjne można umieścić w kontekście w różnych pozycjach 3D, a Atlas wygeneruje świat, który płynnie interpoluje między nimi, tworząc drzwi, korytarze i przejścia, które w wiarygodny sposób łączą obie sceny. Firma stwierdziła również, że model jest zbudowany w sposób skalowalny, a wydajność poprawia się wraz ze wzrostem mocy obliczeniowej podczas treningu.
Doskonałe sterowanie kamerą i długie filmy
Funkcja generowania markiz firmy Atlas to wideo sterowane kamerą. Od jednego do sześciu obrazów wejściowych model może wygenerować do jednej minuty materiału wideo w rozdzielczości 1440p, podążając za precyzyjnie określonymi ścieżkami kamery. World Labs podkreśla, że geometria kamery to natywny typ danych wejściowych — wykraczający poza proste podpowiedzi tekstowe — dzięki czemu twórcy mogą kadrować każde ujęcie i kontrolować każdy ruch. W demonstracjach zespół ręcznie projektował ścieżki kamery przez scenę, aby stworzyć spójny, jednominutowy klip, opisujący wrażenia jako „w fotelu reżysera”, a nie pociąganie za dźwignię automatu.
Model generuje również obrazy i panoramy 360 stopni z tekstu, z możliwością wykonywania złożonych podpowiedzi, renderowania tekstu i tworzenia różnych stylów wizualnych.
Rekonstrukcja rzucająca wyzwanie specjalistycznym modelom
Jeśli chodzi o rekonstrukcję, World Labs odważnie twierdzi: Atlas rekonstruuje sceny ze świata rzeczywistego na podstawie zaledwie dwóch lub trzech zwykłych obrazów, „przewyższając najnowocześniejsze wyniki uzyskiwane dzięki modelom specjalnie przeszkolonym wyłącznie do rekonstrukcji 3D”. Firma nazywa nową syntezę widoku na podstawie nielicznych danych wejściowych podstawowym problemem komputerowego widzenia 3D sprzed kilkudziesięciu lat.
Atlas może także pozyskać ponad sto obrazów wejściowych w celu wiernego odtworzenia rzeczywistych środowisk. Podczas jednej z demonstracji zespół przebudował główny dziedziniec Stanforda kawałek po kawałku z dwóch do dwudziestu pięciu zdjęć z poziomu gruntu, a następnie wygenerował ścieżki powietrzne przelatujące wysoko nad kampusem — wypełniając widoki, których nigdy nie uchwyciła żadna kamera.
Z praktycznego punktu widzenia Atlas nie poprzestaje na klatkach 2D. Natywnie działa na klatkach obrazów i mapach głębi 3D, wyświetlając światy jako chmury punktów lub trójwymiarowe ikony Gaussa, które renderują się na urządzeniu z wysoką rozdzielczością i szybkością klatek. Jest to ta sama reprezentacja, którą zastosowano w Marble, pierwszym produkcie World Labs, więc wyjścia Atlas podłącza się bezpośrednio do istniejącego rurociągu firmy.
Od Bullet Time do szkolenia robotów
Możliwości symulacyjne Atlasu mogą mieć największe znaczenie w robotyce. Firma pokazała, że materiał filmowy z zaledwie trzech zwykłych kamer w telefonach komórkowych — zamontowanych na statywach i zaciskach mieszczących się w plecaku — wystarczy, aby Atlas zrekonstruował scenę i umożliwił zmianę kadru pod niemożliwymi kątami bez konieczności stosowania specjalistycznego studia przechwytywania.
W przypadku procesów Real-to-Sim Atlas rekonstruuje przestrzenie z krótkich filmów wykonanych telefonem, a następnie generuje dane RGB i głębokość, które kamery zamontowane na ciele symulowanego robota obserwowałyby wzdłuż ścieżki – przy czym świat i widok robota pochodzą z tego samego modelu. Firma zademonstrowała nawigację w dużych, zeskanowanych środowiskach przy użyciu 24 klatek każda, a także scenariusze manipulacji, w których symulowane zadania można zmieniać poprzez zmianę obiektów, pozycji i scen po zakończeniu symulacji zadania.
Dlaczego to ma znaczenie
Modele świata są coraz częściej postrzegane jako uzupełnienie dużych modeli językowych: LLM opierają się na opisach świata, podczas gdy modele świata mają na celu modelowanie samego świata – jego geometrii, fizyki i dynamiki w czasie. Jeśli twierdzenia firmy Atlas sprawdzą się w zewnętrznej analizie, zastosowania obejmują efekty wizualne, gry, projektowanie, inżynierię i szkolenie robotów, gdzie syntetyczne, ale fizycznie prawdopodobne środowiska mogłyby radykalnie obniżyć koszty uczenia maszyn działania.
Firma stojąca za tym modelem jest godna uwagi sama w sobie. Firma World Labs została założona przez Fei-Fei Li — profesora na Uniwersytecie Stanforda, którego utworzenie ImageNet pomogło zapoczątkować erę głębokiego uczenia się — wraz z Justinem Johnsonem, Benem Mildenhallem i Christophem Lassnerem, a lista inwestorów obejmuje między innymi a16z, Nvidia, AMD, Intel, Adobe, Salesforce i Samsung. Marble, pierwszy produkt firmy, pozwala użytkownikom tworzyć trwałe światy 3D z obrazów, wideo, tekstu i układów 3D, a firma World Labs twierdzi, że Atlas będzie obsługiwał jego przyszłe wersje.
Atlas nie jest jeszcze ogólnodostępny: firma przyjmuje prośby o wcześniejszy dostęp. Mimo to ta publikacja stanowi jeden z najbardziej konkretnych kroków w dotychczasowej historii systemów sztucznej inteligencji, które nie tylko opisują świat fizyczny, ale utrzymują jego spójny, możliwy do manipulacji model.
---
Wyprzedź sztuczną inteligencjęOtrzymuj najnowsze wiadomości, analizy i przełomowe informacje dotyczące sztucznej inteligencji — wszystko w jednym miejscu.
Przeczytaj więcej aktualności o sztucznej inteligencji →