AI 선구자 Fei-Fei Li가 설립한 공간 지능 회사인 World Labs는 2026년 9월 1일에 Atlas를 출시하며 이를 차세대 "옴니" 세계 모델이라고 설명했습니다. 회사 블로그 게시물에서 팀은 Atlas가 텍스트, 이미지, 비디오 및 3D를 기본적으로 작동하도록 처음부터 사전 훈련되었다고 밝혔습니다. 이는 이러한 작업 중 하나를 전문화하기보다는 세계를 생성, 재구성 및 시뮬레이션하도록 구축된 단일 모델입니다.

이번 출시는 Li가 회사 창립 이후 옹호해온 세계 모델 논문의 이정표입니다. 즉, AI의 다음 개척지는 언어뿐만 아니라 세계가 어떻게 나타나고, 행동하고, 진화하는지 이해하는 시스템에 있다는 것입니다. World Labs는 창의적인 사용자를 위해 상상의 세계를 렌더링하고, 현실 세계를 높은 충실도로 시뮬레이션하고, 로봇이 행동을 계획하도록 돕는 기반으로 이 기술을 구성합니다. 이에 대한 자세한 내용과 기타 선도적인 연구 노력을 알아보려면 AI 산업 보도를 살펴보세요.

하나의 모델, 공유된 공간 컨텍스트

구조적으로 Atlas는 World Labs가 다중 모드 자동 회귀 확산 변환기라고 부르는 것입니다. 대규모 언어 모델과 마찬가지로 먼저 입력을 컨텍스트로 인코딩한 다음 해당 컨텍스트에 따라 출력을 생성합니다. 차이점은 공간적입니다. 각 입력 이미지는 공간의 3D 위치에 기반을 두고 회사에서 공간적 맥락이라고 부르는 것을 형성하고 Atlas는 본 모든 것과 3D 일관성을 유지하면서 그 너머에 있는 것을 상상하면서 다음 단계를 생성합니다.

이러한 설계는 기존 비디오 생성기에 장착하기 어려운 기능을 가능하게 합니다. 두 개의 관련되지 않은 참조 이미지를 서로 다른 3D 위치의 컨텍스트에 배치할 수 있으며 Atlas는 두 장면을 그럴듯하게 연결하는 출입구, 복도 및 전환을 고안하여 두 이미지 사이를 원활하게 보간하는 세계를 생성합니다. 회사는 또한 이 모델이 확장 가능하도록 구축되었으며 훈련 컴퓨팅이 증가함에 따라 성능이 향상된다고 밝혔습니다.

완벽한 픽셀 카메라 제어 및 긴 형식의 비디오

Atlas의 선택 윤곽 생성 기능은 카메라로 제어되는 비디오입니다. 1~6개의 입력 이미지에서 모델은 정확하게 지정된 카메라 경로를 따라 1440p 해상도로 최대 1분의 비디오를 생성할 수 있습니다. World Labs는 카메라 기하학적 구조가 기본 입력 유형이므로 제작자가 모든 샷의 프레임을 맞추고 모든 모션을 제어할 수 있다는 점을 강조합니다. 데모에서 팀은 장면을 통해 손으로 디자인한 카메라 경로를 통해 일관성 있는 1분 길이의 클립을 생성하여 슬롯 머신의 레버를 당기는 것이 아니라 "감독의 의자에 있는" 경험을 설명합니다.

또한 이 모델은 복잡한 프롬프트를 따르고, 텍스트를 렌더링하고, 다양한 시각적 스타일을 생성하는 기능을 통해 텍스트에서 이미지와 360도 파노라마를 생성합니다.

전문 모델에 도전하는 재구성

재구성 측면에서 World Labs는 대담한 주장을 합니다. Atlas는 2~3개의 일반 이미지로 실제 장면을 재구성하며 "3D 재구성용으로만 특별히 훈련된 모델의 최첨단 결과를 능가합니다." 이 회사는 희박한 입력을 통한 새로운 뷰 합성을 3D 컴퓨터 비전의 수십 년 된 근본적인 문제라고 부릅니다.

Atlas는 또한 실제 환경을 충실하게 재현하기 위해 100개 이상의 입력 이미지를 수집할 수 있습니다. 한 시연에서 팀은 스탠포드의 메인 쿼드(Main Quad)를 2장에서 25장의 지상 사진으로 하나씩 재구성한 다음 캠퍼스 위로 높이 날아가는 공중 경로를 생성하여 카메라로 캡처한 적이 없는 뷰를 채웠습니다.

실용적인 측면에서 Atlas는 2D 프레임에서 멈추지 않습니다. 기본적으로 이미지 프레임 및 3D 깊이 맵에서 작동하여 세계를 고해상도 및 프레임 속도로 기기에서 렌더링하는 포인트 클라우드 또는 3D 가우스 스플랫으로 출력합니다. 이는 World Labs의 첫 번째 제품인 Marble에 사용된 것과 동일한 표현이므로 Atlas 출력은 회사의 기존 파이프라인에 직접 연결됩니다.

블렛타임부터 로봇훈련까지

Atlas의 시뮬레이션 기능은 로봇 공학에 가장 중요할 수 있습니다. 이 회사는 배낭에 맞는 삼각대와 클램프가 장착된 일반 휴대폰 카메라 3대만으로 촬영한 영상만으로도 Atlas가 장면을 재구성하고 전문적인 캡처 스튜디오 없이 불가능한 각도에서 "총알 시간" 재구성을 가능하게 하는 데 충분하다는 것을 보여주었습니다.

Real-to-Sim 워크플로우의 경우 Atlas는 짧은 휴대폰 비디오에서 공간을 재구성한 다음 시뮬레이션된 로봇의 신체 장착 카메라가 경로를 따라 관찰할 RGB 및 깊이 데이터를 생성합니다. 세계와 로봇의 시각은 동일한 모델에서 나옵니다. 이 회사는 각각 24개의 프레임을 사용하여 대규모 스캔 환경에 대한 탐색과 작업이 시뮬레이션된 후 개체, 위치 및 장면을 변경하여 시뮬레이션된 작업이 달라질 수 있는 조작 시나리오를 시연했습니다.

중요한 이유

세계 모델은 점차 대규모 언어 모델의 보완물로 간주됩니다. LLM은 세계에 대한 설명을 추론하는 반면, 세계 모델은 세계 자체, 즉 시간에 따른 기하학, 물리학 및 역학을 모델링하는 것을 목표로 합니다. Atlas의 주장이 외부 조사에서도 유효하다면 응용 프로그램은 VFX, 게임, 디자인, 엔지니어링 및 로봇 교육에 걸쳐 적용됩니다. 여기서 합성이지만 물리적으로 그럴듯한 환경에서는 기계 교육 비용을 극적으로 절감할 수 있습니다.

모델 뒤에 있는 회사는 그 자체로 주목할 만합니다. World Labs는 ImageNet을 창안하여 딥 러닝 시대를 촉발한 스탠포드 교수 Fei-Fei Li가 Justin Johnson, Ben Mildenhall, Christoph Lassner와 함께 설립했으며, 투자자 목록에는 a16z, Nvidia, AMD, Intel, Adobe, Salesforce, Samsung 등이 포함됩니다. 회사의 첫 번째 제품인 Marble을 사용하면 사용자는 이미지, 비디오, 텍스트 및 3D 레이아웃을 통해 지속적인 3D 세계를 만들 수 있으며 World Labs는 Atlas가 이 제품의 향후 버전을 지원할 것이라고 밝혔습니다.

Atlas는 아직 일반 출시되지 않았습니다. 회사는 조기 액세스 요청을 받고 있습니다. 그럼에도 불구하고 이번 릴리스는 물리적 세계를 단순히 설명하는 것이 아니라 일관되고 조작 가능한 모델을 보유하는 AI 시스템을 향한 가장 구체적인 단계 중 하나입니다.

---

AI보다 앞서 나가세요

최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.

AI 뉴스 자세히 보기 →