Franska AI-företaget Mistral AI har gett sig in i robotbranschen med Robostral Navigate, en modell med 8 miljarder parametrar som gör det möjligt för robotar att autonomt navigera i komplexa miljöer med bara en enda vanlig RGB-kamera. Modellen, som tillkännagavs den 8 juli 2026, representerar Mistrals första steg mot förkroppsligad AI och fysisk robotik.

Robostral Navigate tar RGB-bilder och en enkel instruktion och flyttar en robot genom en miljö som ett kontor, ett bostadshus eller utomhus. Det som skiljer den är dess hårdvaruminimalism: medan konkurrerande modeller vanligtvis förlitar sig på djupsensorer, LiDAR eller flera kameror som fungerar tillsammans, använder Robostral Navigate bara en standard RGB-kamera och inga djupsensorer alls. Läsare kan följa den senaste AI-utvecklingen på vår hemsida för en omfattande täckning av nya AI-modeller.

Toppmodern prestanda på R2R-CE

Trots sin enkamerametod uppnår Robostral Navigate en framgångsfrekvens på 76,6 % på R2R-CE (Rum-till-Rum i kontinuerliga miljöer) validering unseen benchmark, standardtestet för att följa navigeringsinstruktioner i miljöer som hålls ut under träning. Detta resultat slår den bästa tidigare enkamerametoden med 9,7 procentenheter och överträffar det bästa systemet som använder djupsensorer eller flera kameror med 4,5 poäng, trots att ingen av dem används.

Efter validering når modellen en framgångsgrad på 79,4 %. Enligt Mistral generaliserar modellen över robottyper, körs på hjul-, ben- och till och med flygande robotar, och anpassar sig till robotstorlekar utan omskolning.

Byggd helt i simulering

En av de mest anmärkningsvärda aspekterna av Robostral Navigate är att den byggdes helt internt och tränades uteslutande i simulering. Mistral konstruerade en effektiv datagenereringspipeline som producerade en datauppsättning med cirka 400 000 banor samlade över 6 000 simulerade scener. Detta simuleringsförsta tillvägagångssätt möjliggjorde snabb iteration utan kostnaden och de logistiska utmaningarna med verklig datainsamling.

Modellen är initierad från Mistrals egen vision-språkmodell, som var specialiserad för jordningsuppgifter som pekning, räkning och objektlokalisering. Navigering uppstår som en naturlig förlängning av dessa möjligheter: när modellen väl förstår var saker finns i en bild, lär den sig hur man rör sig mot dem. Noterbart är att Robostral Navigate inte förlitar sig på några befintliga visionspråkmodeller med öppen källkod.

Pekbaserad navigering och förstärkningsinlärning

Robostral Navigate använder en pekningsbaserad navigeringsmekanism. Med tanke på en uppgift och en historik av observationer förutsäger modellen var roboten ska röra sig härnäst genom att sluta sig till bildkoordinaterna för målplatsen i robotens aktuella kameravy, tillsammans med den önskade orienteringen vid ankomst. Detta pekande tillvägagångssätt gör policyn naturligt robust för förändringar i kamerans inneboende och världsskala, till skillnad från kommandon som är beroende av metriska förskjutningar.

När målplatsen ligger utanför det aktuella synfältet och pekning inte gäller, faller modellen tillbaka till förskjutningar i robotens lokala koordinatram. Efter övervakad utbildning tillämpade Mistral förstärkningsinlärning online med sin CISPO-algoritm, vilket gjorde det möjligt för modellen att lära sig av försök och misstag, återhämta sig från misslyckanden och förvärva utforskande beteenden. Bara detta förstärkningsinlärningsstadium förbättrade framgångsfrekvensen med 3,2 procentenheter, och Mistral rapporterar att prestationen fortfarande klättrar utan tecken på platåer.

Effektiv träning via Prefix-Caching

En viktig teknisk innovation är en effektiv träningsalgoritm baserad på prefix-cache. Med hjälp av en trädbaserad strategi för uppmärksamhetsmaskering komprimerar Mistrals metod en hel episod till en enda sekvens, vilket möjliggör träning av alla tidssteg i ett enda framåtpass samtidigt som informationsläckage förhindras mellan tidssteg. Jämfört med träning med ett prov per tidssteg, minskar detta tillvägagångssätt antalet träningstokens med en faktor 22 samtidigt som alla inlärningssignaler bevaras. I praktiken säger företaget att detta förvandlar träningslopp som skulle ta månader till löpningar som slutförs på dagar.

Applikationer och vad som kommer härnäst

Mistral positionerar Robostral Navigate som en av de mest efterfrågade funktionerna för sina kunder idag. Tekniken låser upp applikationer inom tillverkning, leverans, logistik och gästfrihet. Ge modellen en instruktion och den slutför hela uppgiften självständigt och rör sig genom levande utrymmen fulla av människor och hinder som den aldrig visades under träningen.

Företaget beskriver denna release som bara det första steget mot en enhetlig förkroppsligande agent. Mistral utökar aktivt sitt robotteam och söker forskare och ingenjörer. Lanseringen markerar en betydande strategisk expansion för den Paris-baserade startupen, som främst har varit känd för sina stora språkmodeller och nu har signalerat ett seriöst engagemang för fysisk AI och robotik.

Övergången till robotik kommer i takt med att den bredare AI-branschen i allt större utsträckning investerar i förkroppsligad AI, med företag som undersöker hur kapaciteten för språkmodeller kan utökas till fysisk världsinteraktion. Mistrals första simuleringsmetod med en kamera kan sänka barriären för att distribuera autonoma navigationssystem, särskilt i kostnadskänsliga kommersiella applikationer där multisensorinställningar är opraktiska.

Stay ahead of AI

Robostral Navigate är nu tillgängligt för Mistrals kunder. För mer senaste AI-nyheter och analyser, besök AI Buzz Wire.

Läs mer AI-nyheter →