Fransız yapay zeka şirketi Mistral AI, robotların tek bir sıradan RGB kameradan başka bir şey kullanmadan karmaşık ortamlarda otonom olarak gezinmesini sağlayan 8 milyar parametreli bir model olan Robostral Navigate ile robotik alanına girdi. 8 Temmuz 2026'da duyurulan model, Mistral'ın somutlaştırılmış yapay zeka ve fiziksel robotiğe yönelik ilk adımını temsil ediyor.

Robostral Navigate, RGB görüntüleri ve sade bir dille talimatlar alır ve bir robotu ofis, konut binası veya dış mekan gibi bir ortamda hareket ettirir. Onu farklı kılan şey, donanım minimalizmidir: Rakip modeller genellikle derinlik sensörlerine, LiDAR'a veya birlikte çalışan birden fazla kameraya dayanırken, Robostral Navigate yalnızca bir standart RGB kamera kullanır ve hiçbir derinlik sensörü kullanmaz. Yeni ortaya çıkan yapay zeka modeli lansmanlarının kapsamlı kapsamı için okuyucular en son yapay zeka gelişmelerini ana sayfamızdan takip edebilir.

R2R-CE'de Son Teknoloji Performans

Tek kamera yaklaşımına rağmen Robostral Navigate, eğitim sırasında uygulanan ortamlarda navigasyon talimatlarını takip etmek için standart test olan R2R-CE (Sürekli Ortamlarda Odadan Odaya) doğrulama görülmemiş kriterinde %76,6 başarı oranına ulaşır. Bu sonuç, önceki en iyi tek kamera yaklaşımını yüzde 9,7 puanla geride bırakıyor ve derinlik sensörleri veya çoklu kameraları kullanan en iyi sistemi (her ikisini de kullanmamasına rağmen) 4,5 puan geride bırakıyor.

Doğrulamada görülen model %79,4 başarı oranına ulaşıyor. Mistral'a göre model, tekerlekli, bacaklı ve hatta uçan robotlar üzerinde çalışan robot türleri arasında genelleşiyor ve yeniden eğitim gerektirmeden robot boyutlarına uyum sağlıyor.

Tamamen Simülasyonla Oluşturuldu

Robostral Navigate'in en dikkate değer yönlerinden biri tamamen şirket içinde üretilmiş olması ve yalnızca simülasyon konusunda eğitilmiş olmasıdır. Mistral, 6.000 simüle edilmiş sahnede toplanan yaklaşık 400.000 yörüngeden oluşan bir veri kümesi üreten verimli bir veri oluşturma hattı oluşturdu. Bu simülasyon öncelikli yaklaşım, gerçek dünyadaki veri toplamanın maliyet ve lojistik zorlukları olmadan hızlı yinelemeyi mümkün kıldı.

Model, Mistral'in işaretleme, sayma ve nesne lokalizasyonu gibi görevleri temellendirmek için uzmanlaşmış kendi görüş dili modelinden başlatılmıştır. Navigasyon bu yeteneklerin doğal bir uzantısı olarak ortaya çıkıyor: Model, nesnelerin bir görüntüde nerede olduğunu anladıktan sonra onlara nasıl hareket edeceğini öğreniyor. Özellikle Robostral Navigate'in mevcut açık kaynak görsel dil modellerinden hiçbirine dayanmaması dikkat çekicidir.

İşaretleme Tabanlı Gezinme ve Takviyeli Öğrenme

Robostral Navigate, işaretleme tabanlı bir gezinme mekanizması kullanır. Bir görev ve gözlem geçmişi göz önüne alındığında model, robotun mevcut kamera görünümündeki hedef konumun görüntü koordinatlarını ve varış üzerine istenen yönelimi çıkararak robotun bir sonraki adımda nereye hareket etmesi gerektiğini tahmin eder. Bu işaretleme yaklaşımı, metrik yer değiştirmelere dayanan komutların aksine, politikanın kameranın özündeki ve dünya ölçeğindeki değişikliklere karşı doğal olarak dayanıklı olmasını sağlar.

Hedef konum geçerli görüş alanının dışında kaldığında ve işaretleme uygulanamadığında model, robotun yerel koordinat çerçevesindeki yer değiştirmelere geri döner. Denetimli eğitimin ardından Mistral, modelin deneme yanılma yoluyla öğrenmesini, başarısızlıklardan kurtulmasını ve keşfedici davranışlar kazanmasını sağlayan CISPO algoritmasını kullanarak çevrimiçi takviyeli öğrenmeyi uyguladı. Bu takviyeli öğrenme aşaması tek başına başarı oranını yüzde 3,2 puan artırdı ve Mistral, performansın hala bir duraklama belirtisi olmadan tırmandığını bildirdi.

Önek Önbelleğe Alma Yoluyla Verimli Eğitim

Önemli bir teknik yenilik, önek önbelleğe almaya dayalı etkili bir eğitim algoritmasıdır. Ağaç tabanlı bir dikkat maskeleme stratejisi kullanan Mistral'in yöntemi, tüm bir bölümü tek bir diziye sıkıştırarak tek bir ileri geçişte tüm zaman adımlarında eğitime olanak sağlarken zaman adımları arasında bilgi sızıntısını da önler. Her zaman adımı için bir örnekle yapılan eğitimle karşılaştırıldığında bu yaklaşım, tüm öğrenme sinyallerini korurken eğitim belirteçlerinin sayısını 22 kat azaltır. Uygulamada şirket, bunun aylar sürecek eğitim çalışmalarını birkaç günde tamamlanan çalışmalara dönüştürdüğünü söylüyor.

Başvurular ve Sırada Ne Var?

Mistral, Robostral Navigate'i bugün müşterileri için en çok talep edilen yeteneklerden birine hitap edecek şekilde konumlandırıyor. Teknoloji üretim, teslimat, lojistik ve konaklama alanlarındaki uygulamaların kilidini açıyor. Modele bir talimat verdiğinizde, eğitim sırasında hiç gösterilmeyen insanlarla ve engellerle dolu yaşam alanlarında hareket ederek tüm görevi otonom olarak tamamlar.

Şirket, bu sürümü, birleşik ve somutlaşmış bir temsilciye doğru yalnızca ilk adım olarak tanımlıyor. Mistral, robot ekibini aktif olarak genişletiyor ve araştırma bilimcileri ve mühendisleri arıyor. Lansman, öncelikle büyük dil modelleriyle tanınan ve artık fiziksel yapay zeka ve robot bilimine ciddi bir bağlılığın sinyalini veren Paris merkezli girişim için önemli bir stratejik genişlemeye işaret ediyor.

Robotik alanına geçiş, şirketlerin dil modeli yeteneklerinin fiziksel dünya etkileşimine nasıl genişletilebileceğini keşfetmesiyle birlikte, daha geniş yapay zeka endüstrisinin somutlaştırılmış yapay zekaya giderek daha fazla yatırım yapmasıyla birlikte geliyor. Mistral'in simülasyon öncelikli tek kamera yaklaşımı, özellikle çoklu sensör kurulumlarının pratik olmadığı maliyete duyarlı ticari uygulamalarda, otonom navigasyon sistemlerinin konuşlandırılmasının önündeki engeli azaltabilir.

Yapay Zekanın Önünde Olun

Robostral Navigate artık Mistral müşterilerinin kullanımına sunuldu. Daha fazla son dakika yapay zeka haberi ve analizi için AI Buzz Wire'ı ziyaret edin.

Daha fazla AI haberini okuyun →