World Labs, компанія просторового інтелекту, заснована піонером штучного інтелекту Фей-Фей Лі, представила Atlas 1 вересня 2026 року, описавши його як свою всесвітню модель наступного покоління. У публікації в блозі компанії команда повідомила, що Atlas попередньо навчений з нуля для роботи з текстом, зображеннями, відео та 3D — єдиною моделлю, створеною для генерування, реконструкції та моделювання світів, а не для спеціалізації на будь-якому з цих завдань.
Запуск є важливою віхою для тези про моделювання світу, яку Лі відстоював з моменту заснування компанії: наступний рубіж ШІ лежить не лише в мові, а й у системах, які розуміють, як світи з’являються, поводяться та розвиваються. World Labs розглядає цю технологію як основу для відтворення вигаданих світів для творчих користувачів, імітації реального світу з високою точністю та допомоги роботам у плануванні дій. Щоб дізнатися більше про ці та інші передові дослідницькі зусилля, ознайомтеся з охопленням індустрії ШІ.
Одна модель, спільний просторовий контекст
Архітектурно Atlas — це те, що World Labs називає мультимодальним авторегресійним дифузійним трансформатором. Подібно до великої мовної моделі, вона спочатку кодує свої вхідні дані в контекст, а потім генерує вихідні дані відповідно до цього контексту. Різниця полягає в просторі: кожне вхідне зображення базується на 3D-положенні в просторі, утворюючи те, що компанія називає просторовим контекстом, і Atlas генерує те, що буде далі, зберігаючи 3D-узгодженість із усім, що він бачив, — уявляючи, що лежить за ним.
Така конструкція надає можливості, які було б незручно приєднати до звичайних відеогенераторів. Два непов’язаних еталонних зображення можна розмістити в контексті в різних 3D-позиціях, і Atlas створить світ, який плавно вставляється між ними, винаходячи дверні прорізи, коридори та переходи, які правдоподібно з’єднують дві сцени. У компанії також заявили, що модель створена для масштабування, продуктивність покращується зі збільшенням обсягу навчальних обчислень.
Ідеальне керування камерою для пікселів і довгоформатне відео
Функція генерації маркіру Atlas – це відео, кероване камерою. Від одного до шести вхідних зображень, модель може генерувати до однієї хвилини відео з роздільною здатністю 1440p, дотримуючись точно визначених шляхів камери. World Labs наголошує, що геометрія камери є рідним типом введення, що виходить за рамки грубих текстових підказок, тому творці можуть кадрувати кожен знімок і контролювати кожен рух. У демонстраційних роликах команда вручну розробила шляхи камери через сцену, щоб створити послідовний однохвилинний ролик, описуючи досвід як перебування в кріслі режисера, а не тягнути за важіль ігрового автомата.
Модель також створює зображення та 360-градусні панорами з тексту, маючи можливість виконувати складні підказки, відтворювати текст і створювати різноманітні візуальні стилі.
Реконструкція, яка кидає виклик спеціалізованим моделям
Що стосується реконструкції, World Labs робить сміливу заяву: Atlas реконструює сцени реального світу лише з двох-трьох звичайних зображень, «перевершуючи найсучасніші результати моделей, спеціально навчених лише для 3D-реконструкції». Компанія називає новий синтез представлення з розріджених вхідних даних фундаментальною проблемою тривимірного комп’ютерного зору, яка існує десятиліттями.
Atlas також може отримувати більше сотні вхідних зображень для точного відтворення реального середовища. Під час однієї демонстрації команда відновила головний чотирикутник Стенфорда по частинах із двох до двадцяти п’яти фотографій на рівні землі, а потім згенерувала повітряні траєкторії, що летять високо над кампусом, заповнюючи види, які ніколи не знімала жодна камера.
Важливо для практичного використання, Atlas не зупиняється на 2D кадрах. Він працює з кадрами зображень і 3D-картами глибини, виводячи світи як хмари точок або 3D-гауссові знаки, які відображаються на пристрої з високою роздільною здатністю та частотою кадрів. Це те саме представлення, яке використовується в Marble, першому продукті World Labs, тому виходи Atlas підключаються безпосередньо до існуючого трубопроводу компанії.
Від Bullet Time до навчання роботів
Можливості симуляції Atlas можуть мати найбільше значення для робототехніки. Компанія показала, що записів лише з трьох звичайних камер мобільного телефону — встановлених на штативи та затискачі, які поміщаються в рюкзак — достатньо, щоб Atlas відтворив сцену та дозволив перекадрувати «час кулі» з неможливих кутів, не потребуючи спеціальної студії зйомки.
Для робочих процесів Real-to-Sim Atlas реконструює простори з коротких телефонних відео, а потім генерує дані RGB і глибини, які змодельовані камери робота, встановлені на тілі, спостерігали б уздовж шляху — зі світом і поглядом робота на нього надходять з однієї моделі. Компанія продемонструвала навігацію у великих відсканованих середовищах, використовуючи 24 кадри кожен, а також сценарії маніпуляцій, де симульовані завдання можна варіювати шляхом зміни об’єктів, позицій і сцен після моделювання завдання.
Чому це важливо
Світові моделі все частіше розглядаються як доповнення до великих мовних моделей: LLM міркують про описи світу, тоді як світові моделі мають на меті моделювати сам світ — його геометрію, фізику та динаміку в часі. Якщо твердження Atlas витримають під зовнішнім контролем, програми охоплюють VFX, ігри, дизайн, інженерію та навчання роботів, де синтетичні, але фізично правдоподібні середовища можуть значно скоротити витрати на навчання машин діяти.
Компанія, що стоїть за моделлю, сама по собі примітна. World Labs заснував Фей-Фей Лі — професор зі Стенфордського університету, чиє створення ImageNet допомогло розпалити еру глибокого навчання — разом із Джастіном Джонсоном, Беном Мілденхоллом і Крістофом Ласснером, а список інвесторів серед інших включає a16z, Nvidia, AMD, Intel, Adobe, Salesforce і Samsung. Marble, перший продукт компанії, дозволяє користувачам створювати постійні 3D-світи із зображень, відео, тексту та 3D-макетів, і World Labs повідомила, що Atlas буде працювати над його майбутніми версіями.
Atlas ще не є загальнодоступним: компанія приймає запити на ранній доступ. Тим не менш, випуск знаменує собою один із найбільш конкретних кроків до систем штучного інтелекту, які не просто описують фізичний світ, але містять послідовну модель, яку можна маніпулювати.
---
Будьте попереду ШІОтримуйте останні новини штучного інтелекту, аналіз і прориви — усе в одному місці.
Читати більше новин AI →