World Labs, la empresa de inteligencia espacial fundada por el pionero de la IA Fei-Fei Li, presentó Atlas el 1 de septiembre de 2026 y lo describió como su modelo mundial "omni" de próxima generación. En una publicación de blog de la compañía, el equipo dijo que Atlas está previamente entrenado desde cero para operar de forma nativa en texto, imágenes, video y 3D: un modelo único creado para generar, reconstruir y simular mundos en lugar de especializarse en cualquiera de esas tareas.

El lanzamiento es un hito para la tesis de los modelos mundiales que Li ha defendido desde que fundó la empresa: que la próxima frontera de la IA no está solo en el lenguaje, sino en sistemas que comprendan cómo aparecen, se comportan y evolucionan los mundos. World Labs enmarca la tecnología como la base para representar mundos imaginados para usuarios creativos, simular el mundo real en alta fidelidad y ayudar a los robots a planificar acciones. Para obtener más información sobre este y otros esfuerzos de investigación de vanguardia, explore nuestra cobertura de la industria de la IA.

Un modelo, un contexto espacial compartido

Arquitectónicamente, Atlas es lo que World Labs llama un transformador de difusión autorregresivo multimodal. Al igual que un modelo de lenguaje grande, primero codifica sus entradas en un contexto y luego genera salidas condicionadas a ese contexto. La diferencia es espacial: cada imagen de entrada se basa en una posición 3D en el espacio, formando lo que la empresa llama un contexto espacial, y Atlas genera lo que viene a continuación mientras se mantiene coherente en 3D con todo lo que ha visto, imaginando lo que hay más allá.

Ese diseño permite capacidades que sería complicado incorporar a los generadores de vídeo convencionales. Se pueden colocar dos imágenes de referencia no relacionadas en el contexto en diferentes posiciones 3D, y Atlas generará un mundo que se interpola suavemente entre ellas, inventando puertas, pasillos y transiciones que unen de manera plausible las dos escenas. La compañía también dijo que el modelo está construido a escala y que el rendimiento mejora a medida que aumenta la computación de entrenamiento.

Control de cámara perfecto en píxeles y vídeo de formato largo

La función de generación de marquesinas de Atlas es vídeo controlado por cámara. De una a seis imágenes de entrada, el modelo puede generar hasta un minuto de vídeo con una resolución de 1440p, siguiendo rutas de cámara especificadas con precisión. World Labs enfatiza que la geometría de la cámara es un tipo de entrada nativo, que va más allá de las indicaciones de texto, para que los creadores puedan encuadrar cada toma y controlar cada movimiento. En las demostraciones, el equipo diseñó a mano recorridos de cámara a través de una escena para producir un clip coherente de un minuto, describiendo la experiencia como estar "en la silla del director" en lugar de tirar de la palanca de una máquina tragamonedas.

El modelo también genera imágenes y panoramas de 360 ​​grados a partir de texto, con la capacidad de seguir indicaciones complejas, representar texto y producir una variedad de estilos visuales.

Reconstrucción que desafía los modelos especializados

En cuanto a la reconstrucción, World Labs hace una afirmación audaz: Atlas reconstruye escenas del mundo real a partir de tan solo dos o tres imágenes ordinarias, "superando los resultados de última generación de modelos especialmente entrenados sólo para la reconstrucción 3D". La compañía considera que la síntesis de vistas novedosas a partir de entradas escasas es un problema fundamental de décadas en la visión por computadora en 3D.

Atlas también puede incorporar más de cien imágenes de entrada para una recreación fiel de entornos reales. En una demostración, el equipo reconstruyó pieza por pieza el patio principal de Stanford a partir de dos a veinticinco fotografías a nivel del suelo y luego generó trayectorias aéreas que volaban muy por encima del campus, completando vistas que ninguna cámara había capturado jamás.

Lo más importante para el uso práctico es que Atlas no se limita a los fotogramas 2D. Opera de forma nativa en marcos de imágenes y mapas de profundidad 3D, generando mundos como nubes de puntos o símbolos gaussianos 3D que se renderizan en el dispositivo a alta resolución y velocidad de cuadros. Esa es la misma representación utilizada en Marble, el primer producto de World Labs, por lo que los resultados de Atlas se conectan directamente a la tubería existente de la empresa.

Del tiempo bala al entrenamiento de robots

Las capacidades de simulación de Atlas pueden ser las más importantes para la robótica. La compañía demostró que las imágenes de tan solo tres cámaras de teléfonos celulares comunes, montadas con trípodes y abrazaderas que caben en una mochila, son suficientes para que Atlas reconstruya una escena y permita reencuadrar en "tiempo bala" desde ángulos imposibles, sin necesidad de un estudio de captura especializado.

Para flujos de trabajo Real-to-Sim, Atlas reconstruye espacios a partir de videos cortos de teléfono y luego genera los datos RGB y de profundidad que las cámaras montadas en el cuerpo de un robot simulado observarían a lo largo de un camino, con el mundo y la visión del robot provenientes del mismo modelo. La empresa demostró la navegación a través de grandes entornos escaneados utilizando 24 fotogramas cada uno, además de escenarios de manipulación en los que las tareas simuladas se pueden variar cambiando objetos, posiciones y escenas una vez que se simula una tarea.

Por qué es importante

Los modelos mundiales se consideran cada vez más como un complemento de los grandes modelos lingüísticos: los LLM razonan sobre descripciones del mundo, mientras que los modelos mundiales pretenden modelar el mundo mismo: su geometría, física y dinámica a lo largo del tiempo. Si las afirmaciones de Atlas se mantienen bajo el escrutinio externo, las aplicaciones abarcan efectos visuales, juegos, diseño, ingeniería y entrenamiento de robots, donde entornos sintéticos pero físicamente plausibles podrían reducir drásticamente el costo de enseñar a las máquinas a actuar.

La empresa detrás del modelo es notable por derecho propio. World Labs fue fundado por Fei-Fei Li, el profesor de Stanford cuya creación de ImageNet ayudó a iniciar la era del aprendizaje profundo, junto con Justin Johnson, Ben Mildenhall y Christoph Lassner, y su lista de inversores incluye a16z, Nvidia, AMD, Intel, Adobe, Salesforce y Samsung, entre otros. Marble, el primer producto de la compañía, permite a los usuarios crear mundos 3D persistentes a partir de imágenes, videos, textos y diseños 3D, y World Labs dijo que Atlas impulsará futuras versiones del mismo.

Atlas aún no está disponible de forma generalizada: la empresa está aceptando solicitudes de acceso temprano. Aún así, el lanzamiento marca uno de los pasos más concretos hasta el momento hacia sistemas de inteligencia artificial que no se limiten a describir el mundo físico, sino que contengan un modelo consistente y manipulable del mismo.

---

Manténgase a la vanguardia de la IA

Obtenga las últimas noticias, análisis y avances en IA, todo en un solo lugar.

Leer más noticias sobre IA →