World Labs, компания пространственного интеллекта, основанная пионером искусственного интеллекта Фей-Фей Ли, представила Atlas 1 сентября 2026 года, назвав его своей «омни» моделью мира следующего поколения. В сообщении в блоге компании команда сообщила, что Atlas с нуля предварительно обучен работать с текстом, изображениями, видео и 3D — единой моделью, созданной для генерации, реконструкции и моделирования миров, а не для специализации на какой-либо из этих задач.
Запуск является важной вехой для тезиса о моделях мира, который Ли отстаивал с момента основания компании: следующий рубеж ИИ лежит не только в языке, но и в системах, которые понимают, как миры появляются, ведут себя и развиваются. World Labs рассматривает эту технологию как основу для визуализации воображаемых миров для творческих пользователей, моделирования реального мира с высокой точностью и помощи роботам в планировании действий. Дополнительную информацию об этом и других передовых исследованиях можно найти в нашем освещении отрасли искусственного интеллекта.
Одна модель, общий пространственный контекст
С архитектурной точки зрения Atlas — это то, что World Labs называет мультимодальным авторегрессионным диффузионным преобразователем. Как и большая языковая модель, она сначала кодирует входные данные в контекст, а затем генерирует выходные данные, обусловленные этим контекстом. Разница пространственная: каждое входное изображение привязано к трехмерному положению в пространстве, формируя то, что компания называет пространственным контекстом, а Atlas генерирует то, что будет дальше, сохраняя при этом трехмерное соответствие всему, что он видел, — представляя, что находится за его пределами.
Такая конструкция обеспечивает возможности, которые было бы неудобно реализовать на обычных видеогенераторах. Два несвязанных эталонных изображения можно поместить в контекст в разных трехмерных позициях, и Atlas сгенерирует мир, который плавно интерполирует между ними, изобретая дверные проемы, коридоры и переходы, которые правдоподобно соединяют две сцены. Компания также заявила, что модель построена с возможностью масштабирования, а производительность улучшается по мере увеличения вычислительных ресурсов для обучения.
Идеальное управление камерой и длинное видео
Функция создания выделения в Atlas — это видео, управляемое камерой. От одного до шести входных изображений модель может генерировать видео продолжительностью до одной минуты с разрешением 1440p, следуя точно заданному пути камеры. World Labs подчеркивает, что геометрия камеры — это встроенный тип ввода, выходящий за рамки грубых текстовых подсказок, поэтому создатели могут кадрировать каждый кадр и контролировать каждое движение. В демо-версиях команда вручную продумывала путь камеры через сцену, чтобы создать связный одноминутный клип, описывая происходящее как «сидение в режиссерском кресле», а не нажатие на рычаг игрового автомата.
Модель также генерирует изображения и 360-градусные панорамы из текста с возможностью следовать сложным подсказкам, визуализировать текст и создавать различные визуальные стили.
Реконструкция, бросающая вызов специализированным моделям
Что касается реконструкции, World Labs делает смелое заявление: Atlas реконструирует сцены реального мира всего из двух или трех обычных изображений, «превосходя самые современные результаты моделей, специально обученных только для 3D-реконструкции». Компания называет синтез новых представлений из разреженных входных данных фундаментальной проблемой трехмерного компьютерного зрения, существующей уже несколько десятилетий.
Atlas также может принимать более сотни входных изображений для точного воссоздания реальной среды. В ходе одной из демонстраций команда по частям перестроила главный двор Стэнфорда, используя от двух до двадцати пяти фотографий с уровня земли, а затем создала воздушные траектории, летящие высоко над кампусом, заполняя виды, которые никогда не снимала ни одна камера.
Что критически важно для практического использования, Atlas не ограничивается 2D-кадрами. Изначально он работает с кадрами изображений и трехмерными картами глубины, выводя миры в виде облаков точек или трехмерных гауссовских пятен, которые визуализируются на устройстве с высоким разрешением и частотой кадров. Это то же представление, которое используется в Marble, первом продукте World Labs, поэтому результаты Atlas подключаются непосредственно к существующему конвейеру компании.
От Bullet Time к обучению роботов
Возможности моделирования Atlas могут иметь большое значение для робототехники. Компания показала, что видеоматериалов всего с трех обычных камер сотовых телефонов, установленных на штативах и зажимах, которые помещаются в рюкзак, достаточно для того, чтобы Atlas реконструировал сцену и позволил перекадрировать сцену с невозможных углов без необходимости специальной студии захвата.
Для рабочих процессов Real-to-Sim Atlas реконструирует пространства из коротких видеороликов с телефона, а затем генерирует данные RGB и глубины, которые камеры, установленные на теле моделируемого робота, будут наблюдать вдоль пути — при этом мир и представление о нем робота исходят из одной и той же модели. Компания продемонстрировала навигацию в больших сканируемых средах, используя по 24 кадра каждый, а также сценарии манипуляций, в которых моделируемые задачи можно варьировать, изменяя объекты, положения и сцены после моделирования задачи.
Почему это важно
Модели мира все чаще рассматриваются как дополнение к большим языковым моделям: студенты магистратуры рассуждают об описаниях мира, а модели мира направлены на моделирование самого мира — его геометрии, физики и динамики во времени. Если заявления Atlas подтвердятся внешним контролем, приложения охватят VFX, игры, дизайн, проектирование и обучение роботов, где синтетические, но физически правдоподобные среды могут значительно сократить затраты на обучение машин действию.
Компания, создавшая модель, примечательна сама по себе. World Labs была основана Фей-Фей Ли — профессором из Стэнфорда, чье создание ImageNet помогло положить начало эре глубокого обучения — вместе с Джастином Джонсоном, Беном Милденхоллом и Кристофом Ласснером, а в список ее инвесторов входят a16z, Nvidia, AMD, Intel, Adobe, Salesforce и Samsung, среди других. Marble, первый продукт компании, позволяет пользователям создавать постоянные трехмерные миры из изображений, видео, текста и трехмерных макетов, и World Labs заявила, что Atlas станет основой будущих версий этого продукта.
Atlas пока не доступен для общего доступа: компания принимает запросы на ранний доступ. Тем не менее, этот релиз знаменует собой один из наиболее конкретных шагов на пути к системам искусственного интеллекта, которые не просто описывают физический мир, но и содержат последовательную, манипулируемую его модель.
---
Будьте впереди ИИПолучайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.
Подробнее новости AI →