World Labs, compania de inteligență spațială fondată de pionierul AI Fei-Fei Li, a introdus Atlas pe 1 septembrie 2026, descriindu-l drept modelul său mondial „omni” de generație următoare. Într-o postare pe blogul companiei, echipa a spus că Atlas este pregătit de la zero pentru a opera în mod nativ pe text, imagini, video și 3D - un singur model construit pentru a genera, reconstrui și simula lumi, mai degrabă decât să se specializeze în oricare dintre aceste sarcini.
Lansarea este o piatră de hotar pentru teza modelelor mondiale pe care Li a susținut-o de la înființarea companiei: că următoarea frontieră a inteligenței artificiale nu constă doar în limbaj, ci și în sistemele care înțeleg cum apar, se comportă și evoluează lumile. World Labs încadrează tehnologia ca fundament pentru redarea unor lumi imaginare pentru utilizatorii creativi, simulând lumea reală cu fidelitate ridicată și ajutând roboții să planifice acțiuni. Pentru mai multe despre aceasta și despre alte eforturi de cercetare de frontieră, explorați acoperirea industriei AI.
Un model, un context spațial comun
Din punct de vedere arhitectural, Atlas este ceea ce World Labs numește un transformator de difuzie autoregresiv multimodal. La fel ca un model de limbaj mare, mai întâi își codifică intrările într-un context și apoi generează ieșiri condiționate de acel context. Diferența este spațială: fiecare imagine de intrare este bazată pe o poziție 3D în spațiu, formând ceea ce compania numește context spațial, iar Atlas generează ceea ce urmează, rămânând în concordanță 3D cu tot ceea ce a văzut - imaginându-și ce se află dincolo.
Acest design permite capabilități care ar fi incomode să fie fixate pe generatoarele video convenționale. Două imagini de referință fără legătură pot fi plasate în context în poziții 3D diferite, iar Atlas va genera o lume care se interpolează fără probleme între ele, inventând uși, holuri și tranziții care unesc în mod plauzibil cele două scene. Compania a mai spus că modelul este construit la scară, performanța se îmbunătățește pe măsură ce calculul antrenamentului crește.
Control perfect al camerei și video de lungă durată
Caracteristica de generare a marcajului Atlas este video controlat de cameră. De la una la șase imagini de intrare, modelul poate genera până la un minut de video la rezoluție de 1440p, urmând traseele camerei specificate cu precizie. World Labs subliniază faptul că geometria camerei este un tip de intrare nativ – care depășește solicitările de text grosier – astfel încât creatorii să poată încadra fiecare fotografie și să controleze fiecare mișcare. În demonstrații, echipa a proiectat manual traseele camerei printr-o scenă pentru a produce un clip coerent de un minut, descriind experiența ca fiind „pe scaunul regizorului”, mai degrabă decât să trageți de pârghia unui slot machine.
Modelul generează, de asemenea, imagini și panorame la 360 de grade din text, cu capacitatea de a urma solicitări complexe, de a reda text și de a produce o varietate de stiluri vizuale.
Reconstrucție care provoacă modelele de specialitate
În ceea ce privește reconstrucția, World Labs face o afirmație îndrăzneață: Atlas reconstruiește scene din lumea reală din doar două sau trei imagini obișnuite, „depășind rezultatele de ultimă generație prin modele special antrenate doar pentru reconstrucția 3D”. Compania numește sinteza noii vizualizări din intrări rare o problemă fundamentală veche de zeci de ani în viziunea 3D computerizată.
De asemenea, Atlas poate ingera mai mult de o sută de imagini de intrare pentru recrearea fidelă a mediilor reale. Într-o demonstrație, echipa a reconstruit Main Quad-ul lui Stanford bucată cu bucată, de la două până la douăzeci și cinci de fotografii la nivelul solului, apoi a generat trasee aeriene zburând sus deasupra campusului - umplând vederi pe care nicio cameră nu le-a capturat vreodată.
Important pentru utilizare practică, Atlas nu se oprește la cadre 2D. Funcționează în mod nativ pe cadre de imagine și hărți de adâncime 3D, producând lumi ca nori de puncte sau splat-uri gaussiene 3D care redă pe dispozitiv la rezoluție și rate de cadre ridicate. Aceasta este aceeași reprezentare folosită în Marble, primul produs al World Labs, astfel încât ieșirile Atlas se conectează direct la conducta existentă a companiei.
De la Bullet Time la Robot Training
Capacitățile de simulare ale Atlas pot conta cel mai mult pentru robotică. Compania a arătat că înregistrările de la trei camere obișnuite pentru telefoane mobile - montate cu trepieduri și cleme care se potrivesc într-un rucsac - sunt suficiente pentru ca Atlas să reconstituie o scenă și să permită reîncadrarea „bullet time” din unghiuri imposibile, nefiind nevoie de un studio de captură specializat.
Pentru fluxurile de lucru Real-to-Sim, Atlas reconstruiește spații din videoclipuri scurte de pe telefon și apoi generează datele RGB și de profunzime pe care camerele montate pe corp ale robotului simulat le-ar observa de-a lungul unei căi - cu lumea și vederea robotului despre aceasta provenind de la același model. Compania a demonstrat navigarea în medii mari scanate folosind 24 de cadre fiecare, plus scenarii de manipulare în care sarcinile simulate pot fi variate prin schimbarea obiectelor, pozițiilor și scenelor odată ce o sarcină este simulată.
De ce contează
Modelele lumii sunt din ce în ce mai văzute ca o completare a modelelor de limbaj mari: LLM-urile argumentează despre descrierile lumii, în timp ce modelele lumii urmăresc să modeleze lumea însăși - geometria, fizica și dinamica acesteia de-a lungul timpului. Dacă afirmațiile lui Atlas rezistă sub control extern, aplicațiile acoperă efecte vizuale, jocuri, design, inginerie și antrenament de roboți, în care mediile sintetice, dar plauzibile din punct de vedere fizic ar putea reduce drastic costurile de predare a mașinilor să acționeze.
Compania din spatele modelului este notabilă în sine. World Labs a fost fondată de Fei-Fei Li – profesorul de la Stanford a cărui creare a ImageNet a ajutat la aprinderea erei învățării profunde – alături de Justin Johnson, Ben Mildenhall și Christoph Lassner, iar lista sa de investitori include a16z, Nvidia, AMD, Intel, Adobe, Salesforce și Samsung, printre altele. Marble, primul produs al companiei, permite utilizatorilor să creeze lumi 3D persistente din imagini, videoclipuri, text și machete 3D, iar World Labs a spus că Atlas va alimenta versiunile viitoare ale acestuia.
Atlasul nu este încă disponibil în general: compania acceptă cereri de acces anticipat. Cu toate acestea, lansarea marchează unul dintre cei mai concreti pași de până acum către sistemele AI care nu descriu doar lumea fizică, ci dețin un model consistent și manipulabil al acesteia.
---
Rămâneți înaintea AIObțineți cele mai recente știri, analize și descoperiri AI - toate într-un singur loc.
Citește mai multe știri AI →