World Labs، شرکت اطلاعات فضایی که توسط پیشگام هوش مصنوعی Fei-Fei Li تأسیس شد، اطلس را در 1 سپتامبر 2026 معرفی کرد و آن را به عنوان مدل جهانی "omni" نسل بعدی خود معرفی کرد. در یک پست وبلاگ شرکتی، تیم اعلام کرد اطلس از ابتدا آموزش دیده است تا به صورت بومی روی متن، تصاویر، ویدئو و سه بعدی کار کند – یک مدل واحد که برای تولید، بازسازی و شبیه سازی دنیاها به جای تخصص در هر یک از این وظایف ساخته شده است.

این راه‌اندازی نقطه عطفی برای تز مدل‌های جهانی است که لی از زمان تأسیس شرکت دفاع کرده است: اینکه مرز بعدی هوش مصنوعی فقط در زبان نیست، بلکه در سیستم‌هایی است که درک می‌کنند دنیاها چگونه ظاهر می‌شوند، رفتار می‌کنند و تکامل می‌یابند. World Labs این فناوری را به‌عنوان پایه‌ای برای ارائه جهان‌های خیالی برای کاربران خلاق، شبیه‌سازی دنیای واقعی با وفاداری بالا و کمک به ربات‌ها برای برنامه‌ریزی اقدامات قاب می‌کند. برای اطلاعات بیشتر در مورد این و سایر تلاش‌های تحقیقاتی مرزی، [پوشش صنعت AI] ما را کاوش کنید (https://aibuzzwire.news).

یک مدل، یک زمینه فضایی مشترک

از نظر معماری، اطلس همان چیزی است که آزمایشگاه جهانی آن را ترانسفورماتور انتشار اتورگرسیو چندوجهی می نامد. مانند یک مدل زبان بزرگ، ابتدا ورودی های خود را در یک زمینه رمزگذاری می کند و سپس خروجی هایی را مشروط به آن زمینه تولید می کند. تفاوت فضایی است: هر تصویر ورودی در یک موقعیت سه بعدی در فضا قرار می گیرد و آنچه را که شرکت آن را زمینه فضایی می نامد تشکیل می دهد، و اطلس آنچه را که بعدا می آید تولید می کند در حالی که با هر چیزی که دیده است به صورت سه بعدی سازگار می ماند - تصور آنچه فراتر از آن است.

این طراحی قابلیت‌هایی را امکان‌پذیر می‌کند که پیچ‌شدن آن‌ها بر روی ژنراتورهای ویدیویی معمولی دشوار است. دو تصویر مرجع نامرتبط را می‌توان در موقعیت‌های سه‌بعدی مختلف در متن قرار داد، و اطلس دنیایی را ایجاد می‌کند که به آرامی بین آن‌ها درون‌یابی می‌کند، درگاه‌ها، راهروها و انتقال‌هایی را اختراع می‌کند که به طور قابل قبولی این دو صحنه را پل می‌کنند. این شرکت همچنین گفت که این مدل در مقیاس ساخته شده است و عملکرد آن با افزایش محاسبات آموزشی بهبود می یابد.

کنترل دوربین Pixel-Perfect و ویدیوی طولانی

ویژگی تولید خیمه شب بازی اطلس، ویدیوی کنترل شده با دوربین است. از یک تا شش تصویر ورودی، این مدل می‌تواند تا یک دقیقه ویدیو با وضوح 1440p تولید کند، که مسیرهای دوربین دقیقاً مشخص شده را دنبال می‌کند. World Labs تاکید می‌کند که هندسه دوربین یک نوع ورودی بومی است - فراتر از اعلان‌های متنی درشت - بنابراین سازندگان می‌توانند هر شات را کادربندی کنند و هر حرکتی را کنترل کنند. در دموها، تیم با طراحی دستی دوربین، مسیرهای دوربین را از طریق یک صحنه برای تولید یک کلیپ یک دقیقه‌ای منسجم می‌گذراند و تجربه را به‌عنوان «روی صندلی کارگردان» توصیف می‌کند تا اینکه اهرم دستگاه اسلات را بکشد.

این مدل همچنین تصاویر و پانورامای 360 درجه را از متن تولید می کند، با قابلیت پیروی از دستورات پیچیده، رندر متن و تولید انواع سبک های بصری.

بازسازی که مدل های تخصصی را به چالش می کشد

در بخش بازسازی، World Labs ادعای جسورانه ای دارد: اطلس صحنه های دنیای واقعی را از حداقل دو یا سه تصویر معمولی بازسازی می کند، "با مدل هایی که به طور ویژه برای بازسازی سه بعدی آموزش دیده اند، بهتر از بهترین نتایج به دست می آید." این شرکت سنتز نمای جدید از ورودی های پراکنده را یک مشکل اساسی دهه ها در بینایی کامپیوتری سه بعدی می نامد.

اطلس همچنین می تواند بیش از صد تصویر ورودی را برای بازآفرینی صادقانه محیط های واقعی دریافت کند. در یک نمایش، تیم چهار تایی اصلی استنفورد را تکه تکه از دو تا بیست و پنج عکس در سطح زمین بازسازی کرد، سپس مسیرهای هوایی را که در بالای محوطه دانشگاه پرواز می‌کردند ایجاد کردند - منظره‌هایی را که هیچ دوربینی تاکنون ثبت نکرده بود پر می‌کرد.

برای استفاده عملی، اطلس در فریم های دو بعدی متوقف نمی شود. این به طور بومی بر روی فریم‌های تصویر و نقشه‌های عمق سه‌بعدی کار می‌کند و دنیاها را به‌صورت ابرهای نقطه‌ای یا اسپل‌های سه‌بعدی گاوسی تولید می‌کند که روی دستگاه با وضوح و نرخ فریم بالا نمایش داده می‌شوند. این همان نمایشی است که در Marble، اولین محصول آزمایشگاه جهانی استفاده می‌شود، بنابراین خروجی‌های Atlas مستقیماً به خط لوله فعلی شرکت متصل می‌شوند.

از زمان گلوله تا آموزش ربات

قابلیت‌های شبیه‌سازی اطلس ممکن است برای روباتیک بیشترین اهمیت را داشته باشد. این شرکت نشان داد که فیلم‌برداری از سه دوربین معمولی تلفن همراه - مجهز به سه پایه و گیره‌هایی که در یک کوله پشتی قرار می‌گیرند - برای اطلس کافی است تا یک صحنه را بازسازی کند و «زمان گلوله» را از زوایای غیرممکن بازسازی کند، بدون نیاز به استودیوی عکاسی تخصصی.

برای جریان‌های کاری Real-to-Sim، اطلس فضاها را از ویدیوهای کوتاه تلفن بازسازی می‌کند و سپس داده‌های RGB و عمقی را تولید می‌کند که دوربین‌های شبیه‌سازی شده روی بدنه ربات در طول مسیر مشاهده می‌کنند - با جهان و دید ربات از آن از همان مدل. این شرکت ناوبری را در محیط‌های بزرگ اسکن‌شده با استفاده از 24 فریم به‌علاوه سناریوهای دستکاری نشان داد که در آن وظایف شبیه‌سازی شده را می‌توان با تغییر اشیا، موقعیت‌ها و صحنه‌ها پس از شبیه‌سازی یک کار، تغییر داد.

چرا مهم است

مدل‌های جهانی به‌طور فزاینده‌ای به‌عنوان مکملی برای مدل‌های زبانی بزرگ در نظر گرفته می‌شوند: LLM‌ها درباره توصیف جهان استدلال می‌کنند، در حالی که مدل‌های جهانی هدفشان مدل‌سازی خود جهان - هندسه، فیزیک و دینامیک آن در طول زمان است. اگر ادعاهای اطلس تحت بررسی های خارجی باقی بماند، برنامه های کاربردی شامل VFX، بازی، طراحی، مهندسی و آموزش ربات می شوند، جایی که محیط های مصنوعی اما از نظر فیزیکی قابل قبول می توانند هزینه آموزش ماشین ها را به طور چشمگیری کاهش دهند.

شرکت سازنده این مدل در نوع خود قابل توجه است. World Labs توسط Fei-Fei Li - استاد دانشگاه استنفورد که ایجاد ImageNet به شعله‌ور شدن دوران یادگیری عمیق کمک کرد - در کنار جاستین جانسون، بن میلدنهال و کریستوف لاسنر تأسیس شد و فهرست سرمایه‌گذاران آن شامل a16z، Nvidia، AMD، Intel، Adobe، Salesforce، و سامسونگ و غیره است. Marble، اولین محصول این شرکت، به کاربران اجازه می‌دهد تا جهان‌های سه‌بعدی پایداری را از تصاویر، ویدئو، متن و طرح‌بندی‌های سه‌بعدی ایجاد کنند، و World Labs گفت که Atlas نسخه‌های بعدی آن را تامین خواهد کرد.

Atlas هنوز به طور کلی در دسترس نیست: این شرکت درخواست‌هایی را برای دسترسی زودهنگام می‌پذیرد. با این حال، انتشار یکی از ملموس‌ترین گام‌ها به سوی سیستم‌های هوش مصنوعی است که صرفاً دنیای فیزیکی را توصیف نمی‌کنند، بلکه یک مدل ثابت و قابل دستکاری از آن را در خود دارند.

---

از هوش مصنوعی جلوتر بمانید

آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.

بیشتر بخوانید اخبار هوش مصنوعی →