Syarikat AI Perancis Mistral AI telah memasuki ruang robotik dengan Robostral Navigate, model 8 bilion parameter yang membolehkan robot menavigasi persekitaran kompleks secara autonomi menggunakan tidak lebih daripada satu kamera RGB biasa. Model itu, yang diumumkan pada 8 Julai 2026, mewakili langkah pertama Mistral ke dalam AI yang terkandung dan robotik fizikal.

Robostral Navigate mengambil imej RGB dan arahan bahasa biasa dan menggerakkan robot melalui persekitaran seperti pejabat, bangunan kediaman atau ruang luar. Apa yang membezakannya ialah minimalisme perkakasannya: manakala model bersaing biasanya bergantung pada penderia kedalaman, LiDAR, atau berbilang kamera yang berfungsi secara konsert, Robostral Navigate hanya menggunakan satu kamera RGB standard dan tiada apa-apa penderia kedalaman. Untuk liputan komprehensif mengenai pelancaran model AI yang baru muncul, pembaca boleh mengikuti perkembangan AI terkini di halaman utama kami.

Persembahan Terkini pada R2R-CE

Walaupun pendekatan kamera tunggalnya, Robostral Navigate mencapai kadar kejayaan 76.6% pada penanda aras tidak kelihatan pengesahan R2R-CE (Room-to-Room in Continuous Environments), ujian standard untuk mengikuti arahan navigasi dalam persekitaran yang diadakan semasa latihan. Keputusan ini mengatasi pendekatan kamera tunggal terbaik sebelum ini sebanyak 9.7 mata peratusan dan mengatasi sistem terbaik menggunakan penderia kedalaman atau berbilang kamera sebanyak 4.5 mata, walaupun tidak menggunakan kedua-duanya.

Pada pengesahan yang dilihat, model mencapai kadar kejayaan 79.4%. Menurut Mistral, model itu membuat generalisasi merentas jenis robot, berjalan di atas robot beroda, berkaki, dan juga terbang, dan menyesuaikan diri dengan saiz robot tanpa latihan semula.

Dibina Sepenuhnya dalam Simulasi

Salah satu aspek Robostral Navigate yang paling ketara ialah ia dibina sepenuhnya secara dalaman dan dilatih secara eksklusif dalam simulasi. Mistral membina saluran paip penjanaan data yang cekap yang menghasilkan set data kira-kira 400,000 trajektori yang dikumpul merentas 6,000 adegan simulasi. Pendekatan simulasi pertama ini membolehkan lelaran pantas tanpa kos dan cabaran logistik pengumpulan data dunia sebenar.

Model ini dimulakan daripada model bahasa penglihatan Mistral sendiri, yang dikhususkan untuk tugas pembumian seperti menunjuk, mengira dan penyetempatan objek. Navigasi muncul sebagai lanjutan semula jadi kepada keupayaan ini: setelah model memahami lokasi sesuatu dalam imej, ia belajar cara bergerak ke arahnya. Terutama, Robostral Navigate tidak bergantung pada mana-mana model bahasa penglihatan sumber terbuka sedia ada.

Navigasi Berasaskan Penunjukan dan Pembelajaran Pengukuhan

Robostral Navigate menggunakan mekanisme navigasi berasaskan penunjuk. Memandangkan tugas dan sejarah pemerhatian, model meramalkan tempat robot harus bergerak seterusnya dengan membuat kesimpulan koordinat imej lokasi sasaran dalam paparan kamera semasa robot, bersama-sama dengan orientasi yang dikehendaki semasa ketibaan. Pendekatan menunjuk ini menjadikan dasar itu kukuh secara semula jadi kepada perubahan dalam intrinsik kamera dan skala dunia, tidak seperti arahan yang bergantung pada anjakan metrik.

Apabila lokasi sasaran terletak di luar medan pandangan semasa dan penunjuk tidak terpakai, model akan kembali kepada anjakan dalam bingkai koordinat tempatan robot. Selepas latihan yang diselia, Mistral menggunakan pembelajaran pengukuhan dalam talian menggunakan algoritma CISPOnya, yang membolehkan model belajar daripada percubaan dan kesilapan, pulih daripada kegagalan dan memperoleh tingkah laku penerokaan. Peringkat pembelajaran pengukuhan ini sahaja meningkatkan kadar kejayaan sebanyak 3.2 mata peratusan, dan Mistral melaporkan bahawa prestasi masih meningkat tanpa tanda-tanda peningkatan.

Latihan Cekap melalui Prefix-Caching

Inovasi teknikal utama ialah algoritma latihan yang cekap berdasarkan cache-prefix. Menggunakan strategi menutup perhatian berasaskan pokok, kaedah Mistral memampatkan keseluruhan episod ke dalam satu urutan, membolehkan latihan pada semua langkah masa dalam satu hantaran ke hadapan sambil menghalang kebocoran maklumat antara langkah masa. Berbanding dengan latihan dengan satu sampel setiap langkah masa, pendekatan ini mengurangkan bilangan token latihan dengan faktor 22 sambil mengekalkan semua isyarat pembelajaran. Dalam amalan, syarikat mengatakan ini mengubah larian latihan yang akan mengambil masa berbulan-bulan menjadi larian yang selesai dalam beberapa hari.

Aplikasi dan Perkara Seterusnya

Mistral meletakkan Robostral Navigate sebagai menangani salah satu keupayaan yang paling diminati untuk pelanggannya hari ini. Teknologi ini membuka kunci aplikasi merentas pembuatan, penghantaran, logistik dan hospitaliti. Beri model satu arahan dan ia menyelesaikan keseluruhan tugasan secara autonomi, bergerak melalui ruang langsung yang penuh dengan orang dan halangan yang tidak pernah ditunjukkan semasa latihan.

Syarikat itu menyifatkan keluaran ini hanya sebagai langkah pertama ke arah ejen terwujud bersatu. Mistral sedang giat mengembangkan pasukan robotiknya dan mencari saintis dan jurutera penyelidikan. Pelancaran itu menandakan pengembangan strategik yang ketara untuk permulaan yang berpangkalan di Paris, yang terkenal terutamanya dengan model bahasanya yang besar dan kini telah menandakan komitmen yang serius terhadap AI fizikal dan robotik.

Pergerakan ke robotik datang apabila industri AI yang lebih luas semakin melabur dalam AI yang terkandung, dengan syarikat meneroka bagaimana keupayaan model bahasa boleh diperluaskan kepada interaksi dunia fizikal. Pendekatan kamera tunggal yang diutamakan oleh simulasi Mistral boleh mengurangkan halangan untuk menggunakan sistem navigasi autonomi, terutamanya dalam aplikasi komersial yang sensitif kos di mana persediaan berbilang sensor tidak praktikal.

Kekal Mendahului AI

Robostral Navigate kini tersedia untuk pelanggan Mistral. Untuk lebih banyak berita terkini dan analisis AI, lawati AI Buzz Wire.

Baca lebih banyak berita AI →