Французька компанія штучного інтелекту Mistral AI увійшла в простір робототехніки з Robostral Navigate, моделлю з 8 мільярдами параметрів, яка дозволяє роботам автономно орієнтуватися в складних середовищах, використовуючи лише одну звичайну RGB-камеру. Модель, анонсована 8 липня 2026 року, являє собою перший крок Mistral до втіленого ШІ та фізичної робототехніки.

Robostral Navigate отримує RGB-зображення та інструкції простою мовою та переміщує робота через таке середовище, як офіс, житловий будинок або відкритий простір. Що відрізняє його від апаратного мінімалізму: у той час як конкуруючі моделі зазвичай покладаються на датчики глибини, LiDAR або кілька камер, що працюють узгоджено, Robostral Navigate використовує лише одну стандартну камеру RGB і не використовує жодних датчиків глибини. Читачі можуть стежити за останніми розробками штучного інтелекту на нашій домашній сторінці.

Найсучасніша продуктивність на R2R-CE

Незважаючи на підхід із використанням однієї камери, Robostral Navigate досягає 76,6% успіху в невидимому тесті перевірки R2R-CE (Room-to-Room in Continuous Environments), стандартному тесті на дотримання навігаційних інструкцій у середовищах, які проводяться під час навчання. Цей результат перевершує найкращий попередній підхід з однією камерою на 9,7 відсоткових пунктів і перевершує найкращу систему з використанням датчиків глибини або кількох камер на 4,5 бала, незважаючи на те, що жодного з них не було використано.

Після перевірки модель досягає 79,4% успіху. За словами Містраля, модель узагальнює типи роботів, які працюють на колесах, ногах і навіть літаючих роботах, і адаптується до розмірів роботів без перенавчання.

Повністю створено в симуляції

Одним із найбільш помітних аспектів Robostral Navigate є те, що він був повністю створений власними силами та навчався виключно симуляції. Mistral побудував ефективний конвеєр генерації даних, який створив набір даних із приблизно 400 000 траєкторій, зібраних у 6 000 змодельованих сценах. Цей підхід, заснований на першому моделюванні, дозволив швидко ітерувати без витрат і логістичних проблем зі збором даних у реальному світі.

Модель ініціалізовано з власної моделі мови Mistral, яка була спеціалізована для таких завдань, як вказівка, підрахунок і локалізація об’єктів. Навігація виникає як природне розширення цих можливостей: як тільки модель розуміє, де знаходяться предмети на зображенні, вона вчиться, як рухатися до них. Примітно, що Robostral Navigate не покладається на будь-яку існуючу модель візуальної мови з відкритим кодом.

Навігація за допомогою вказівника та підкріплення

Robostral Navigate використовує навігаційний механізм на основі вказівника. Враховуючи завдання та історію спостережень, модель передбачає, куди робот має рухатися далі, виводячи координати зображення цільового місця в поточному поданні камери робота разом із бажаною орієнтацією після прибуття. Цей підхід до вказівки робить політику природно стійкою до змін внутрішніх характеристик камери та світового масштабу, на відміну від команд, які покладаються на метричні переміщення.

Коли цільове розташування лежить за межами поточного поля зору і наведення не застосовується, модель повертається до зміщень у локальній системі координат робота. Після навчання під наглядом Mistral застосував онлайн-навчання з підкріпленням за допомогою свого алгоритму CISPO, який дозволив моделі навчатися методом проб і помилок, відновлюватися після невдач і набувати дослідницької поведінки. Лише цей етап навчання з підкріпленням покращив рівень успіху на 3,2 відсоткових пункти, і Mistral повідомляє, що продуктивність все ще підвищується без ознак плато.

Ефективне навчання за допомогою кешування префіксів

Ключовою технічною інновацією є ефективний алгоритм навчання на основі кешування префіксів. Використовуючи деревовидну стратегію маскування уваги, метод Mistral стискає весь епізод в одну послідовність, що дозволяє тренуватися на всіх часових кроках за один прохід вперед, запобігаючи витоку інформації між часовими кроками. Порівняно з навчанням з одним зразком на крок часу, цей підхід зменшує кількість навчальних маркерів у 22 рази, зберігаючи при цьому всі сигнали навчання. На практиці компанія каже, що це перетворює тренувальні пробіжки, які триватимуть місяці, на пробіжки, які завершуються днями.

Програми та те, що буде далі

Mistral позиціонує Robostral Navigate як одну з найбільш затребуваних можливостей для своїх клієнтів сьогодні. Технологія розблоковує застосування у виробництві, доставці, логістиці та гостинності. Дайте моделі одну інструкцію, і вона виконає все завдання автономно, пересуваючись живими просторами, повними людей і перешкод, які їй ніколи не показувалися під час навчання.

Компанія описує цей випуск лише як перший крок до уніфікованого втіленого агента. Mistral активно розширює свою робототехнічну команду та шукає вчених-дослідників та інженерів. Запуск знаменує собою значне стратегічне розширення паризького стартапу, який був відомий насамперед своїми великими мовними моделями, а тепер засвідчив серйозну прихильність до фізичного ШІ та робототехніки.

Перехід до робототехніки відбувається в той момент, коли ширша індустрія штучного інтелекту все більше інвестує у втілений штучний інтелект, а компанії досліджують, як можливості мовної моделі можна розширити до взаємодії фізичного світу. Підхід Mistral до моделювання з використанням однієї камери може знизити перешкоди для розгортання автономних навігаційних систем, особливо в чутливих до витрат комерційних додатках, де встановлення кількох датчиків є непрактичним.

Будьте попереду ШІ

Robostral Navigate тепер доступний для клієнтів Mistral. Щоб отримати більше актуальних новин та аналізу AI, відвідайте AI Buzz Wire.

Читати більше новин AI →