World Labs، شرکت اطلاعات فضایی که توسط پیشگام هوش مصنوعی Fei-Fei Li تأسیس شد، اطلس را در 1 سپتامبر 2026 معرفی کرد و آن را به عنوان مدل جهانی "omni" نسل بعدی خود معرفی کرد. در یک پست وبلاگ شرکتی، تیم اعلام کرد اطلس از ابتدا آموزش دیده است تا به صورت بومی روی متن، تصاویر، ویدئو و سه بعدی کار کند – یک مدل واحد که برای تولید، بازسازی و شبیه سازی دنیاها به جای تخصص در هر یک از این وظایف ساخته شده است.
این راهاندازی نقطه عطفی برای تز مدلهای جهانی است که لی از زمان تأسیس شرکت دفاع کرده است: اینکه مرز بعدی هوش مصنوعی فقط در زبان نیست، بلکه در سیستمهایی است که درک میکنند دنیاها چگونه ظاهر میشوند، رفتار میکنند و تکامل مییابند. World Labs این فناوری را بهعنوان پایهای برای ارائه جهانهای خیالی برای کاربران خلاق، شبیهسازی دنیای واقعی با وفاداری بالا و کمک به رباتها برای برنامهریزی اقدامات قاب میکند. برای اطلاعات بیشتر در مورد این و سایر تلاشهای تحقیقاتی مرزی، [پوشش صنعت AI] ما را کاوش کنید (https://aibuzzwire.news).
یک مدل، یک زمینه فضایی مشترک
از نظر معماری، اطلس همان چیزی است که آزمایشگاه جهانی آن را ترانسفورماتور انتشار اتورگرسیو چندوجهی می نامد. مانند یک مدل زبان بزرگ، ابتدا ورودی های خود را در یک زمینه رمزگذاری می کند و سپس خروجی هایی را مشروط به آن زمینه تولید می کند. تفاوت فضایی است: هر تصویر ورودی در یک موقعیت سه بعدی در فضا قرار می گیرد و آنچه را که شرکت آن را زمینه فضایی می نامد تشکیل می دهد، و اطلس آنچه را که بعدا می آید تولید می کند در حالی که با هر چیزی که دیده است به صورت سه بعدی سازگار می ماند - تصور آنچه فراتر از آن است.
این طراحی قابلیتهایی را امکانپذیر میکند که پیچشدن آنها بر روی ژنراتورهای ویدیویی معمولی دشوار است. دو تصویر مرجع نامرتبط را میتوان در موقعیتهای سهبعدی مختلف در متن قرار داد، و اطلس دنیایی را ایجاد میکند که به آرامی بین آنها درونیابی میکند، درگاهها، راهروها و انتقالهایی را اختراع میکند که به طور قابل قبولی این دو صحنه را پل میکنند. این شرکت همچنین گفت که این مدل در مقیاس ساخته شده است و عملکرد آن با افزایش محاسبات آموزشی بهبود می یابد.
کنترل دوربین Pixel-Perfect و ویدیوی طولانی
ویژگی تولید خیمه شب بازی اطلس، ویدیوی کنترل شده با دوربین است. از یک تا شش تصویر ورودی، این مدل میتواند تا یک دقیقه ویدیو با وضوح 1440p تولید کند، که مسیرهای دوربین دقیقاً مشخص شده را دنبال میکند. World Labs تاکید میکند که هندسه دوربین یک نوع ورودی بومی است - فراتر از اعلانهای متنی درشت - بنابراین سازندگان میتوانند هر شات را کادربندی کنند و هر حرکتی را کنترل کنند. در دموها، تیم با طراحی دستی دوربین، مسیرهای دوربین را از طریق یک صحنه برای تولید یک کلیپ یک دقیقهای منسجم میگذراند و تجربه را بهعنوان «روی صندلی کارگردان» توصیف میکند تا اینکه اهرم دستگاه اسلات را بکشد.
این مدل همچنین تصاویر و پانورامای 360 درجه را از متن تولید می کند، با قابلیت پیروی از دستورات پیچیده، رندر متن و تولید انواع سبک های بصری.
بازسازی که مدل های تخصصی را به چالش می کشد
در بخش بازسازی، World Labs ادعای جسورانه ای دارد: اطلس صحنه های دنیای واقعی را از حداقل دو یا سه تصویر معمولی بازسازی می کند، "با مدل هایی که به طور ویژه برای بازسازی سه بعدی آموزش دیده اند، بهتر از بهترین نتایج به دست می آید." این شرکت سنتز نمای جدید از ورودی های پراکنده را یک مشکل اساسی دهه ها در بینایی کامپیوتری سه بعدی می نامد.
اطلس همچنین می تواند بیش از صد تصویر ورودی را برای بازآفرینی صادقانه محیط های واقعی دریافت کند. در یک نمایش، تیم چهار تایی اصلی استنفورد را تکه تکه از دو تا بیست و پنج عکس در سطح زمین بازسازی کرد، سپس مسیرهای هوایی را که در بالای محوطه دانشگاه پرواز میکردند ایجاد کردند - منظرههایی را که هیچ دوربینی تاکنون ثبت نکرده بود پر میکرد.
برای استفاده عملی، اطلس در فریم های دو بعدی متوقف نمی شود. این به طور بومی بر روی فریمهای تصویر و نقشههای عمق سهبعدی کار میکند و دنیاها را بهصورت ابرهای نقطهای یا اسپلهای سهبعدی گاوسی تولید میکند که روی دستگاه با وضوح و نرخ فریم بالا نمایش داده میشوند. این همان نمایشی است که در Marble، اولین محصول آزمایشگاه جهانی استفاده میشود، بنابراین خروجیهای Atlas مستقیماً به خط لوله فعلی شرکت متصل میشوند.
از زمان گلوله تا آموزش ربات
قابلیتهای شبیهسازی اطلس ممکن است برای روباتیک بیشترین اهمیت را داشته باشد. این شرکت نشان داد که فیلمبرداری از سه دوربین معمولی تلفن همراه - مجهز به سه پایه و گیرههایی که در یک کوله پشتی قرار میگیرند - برای اطلس کافی است تا یک صحنه را بازسازی کند و «زمان گلوله» را از زوایای غیرممکن بازسازی کند، بدون نیاز به استودیوی عکاسی تخصصی.
برای جریانهای کاری Real-to-Sim، اطلس فضاها را از ویدیوهای کوتاه تلفن بازسازی میکند و سپس دادههای RGB و عمقی را تولید میکند که دوربینهای شبیهسازی شده روی بدنه ربات در طول مسیر مشاهده میکنند - با جهان و دید ربات از آن از همان مدل. این شرکت ناوبری را در محیطهای بزرگ اسکنشده با استفاده از 24 فریم بهعلاوه سناریوهای دستکاری نشان داد که در آن وظایف شبیهسازی شده را میتوان با تغییر اشیا، موقعیتها و صحنهها پس از شبیهسازی یک کار، تغییر داد.
چرا مهم است
مدلهای جهانی بهطور فزایندهای بهعنوان مکملی برای مدلهای زبانی بزرگ در نظر گرفته میشوند: LLMها درباره توصیف جهان استدلال میکنند، در حالی که مدلهای جهانی هدفشان مدلسازی خود جهان - هندسه، فیزیک و دینامیک آن در طول زمان است. اگر ادعاهای اطلس تحت بررسی های خارجی باقی بماند، برنامه های کاربردی شامل VFX، بازی، طراحی، مهندسی و آموزش ربات می شوند، جایی که محیط های مصنوعی اما از نظر فیزیکی قابل قبول می توانند هزینه آموزش ماشین ها را به طور چشمگیری کاهش دهند.
شرکت سازنده این مدل در نوع خود قابل توجه است. World Labs توسط Fei-Fei Li - استاد دانشگاه استنفورد که ایجاد ImageNet به شعلهور شدن دوران یادگیری عمیق کمک کرد - در کنار جاستین جانسون، بن میلدنهال و کریستوف لاسنر تأسیس شد و فهرست سرمایهگذاران آن شامل a16z، Nvidia، AMD، Intel، Adobe، Salesforce، و سامسونگ و غیره است. Marble، اولین محصول این شرکت، به کاربران اجازه میدهد تا جهانهای سهبعدی پایداری را از تصاویر، ویدئو، متن و طرحبندیهای سهبعدی ایجاد کنند، و World Labs گفت که Atlas نسخههای بعدی آن را تامین خواهد کرد.
Atlas هنوز به طور کلی در دسترس نیست: این شرکت درخواستهایی را برای دسترسی زودهنگام میپذیرد. با این حال، انتشار یکی از ملموسترین گامها به سوی سیستمهای هوش مصنوعی است که صرفاً دنیای فیزیکی را توصیف نمیکنند، بلکه یک مدل ثابت و قابل دستکاری از آن را در خود دارند.
---
از هوش مصنوعی جلوتر بمانیدآخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.
بیشتر بخوانید اخبار هوش مصنوعی →