Google DeepMind har lanserat Gemini Robotics 2, en familj av fysiska AI-modeller som enligt labbet på ett intelligent sätt kan styra alla typer av robotar – från arbetsstationer med dubbla armar till fulla humanoida kroppar – vilket markerar företagets hittills mest ambitiösa insats i världen av rörliga maskiner.

Utgivningen tillkännagavs den 30 juli 2026 och fokuserar på en vision-language-action-modell (VLA) som omvandlar det en robot ser och hör till exakta motorkommandon. DeepMind beskriver det som intelligensskiktet för robotik för allmänt bruk, och företaget placerade lanseringen som en vändpunkt för att ta ut AI från chattfönster och in i den fysiska världen. För mer om den bredare branschens strävan mot förkroppsligad AI, följ våra brytande AI-nyheter.

Tre modeller, ett system

DeepMind skickade tre kompletterande modeller i Gemini Robotics 2-serien:

  • Gemini Robotics 2 — flaggskeppet VLA-modellen som översätter syn och språk till motorstyrning, vilket gör att en robot kan vidta fysiska åtgärder.
  • Gemini Robotics ER 2 — en förkroppsligande resonerande modell som kan förstå fysiska utrymmen och producera detaljerade flerstegsplaner som samordnar med människor och andra robotar.
  • Gemini Robotics On-Device 2 — en lätt version av VLA-modellen optimerad för att köras lokalt på robothårdvara, vilket minskar beroendet av molnanslutningar.

Enligt DeepMind-bloggen har varje modell en specialistroll men trion är designad att fungera som ett enda integrerat system. VLA-modellen hanterar åtgärder i realtid, ER-modellen hanterar planering på högre nivå, och varianten på enheten möjliggör svar med låg latens på själva roboten.

Från fötter till fingertoppar

Det mest slående påståendet i tillkännagivandet är vad DeepMind kallar intelligent helkroppskontroll. Istället för att träna en robot att upprepa en rörelse, är Gemini Robotics 2 designad för att styra en hel humanoid kropp - från fötter till fingertoppar - vilket möjliggör mänskliga rörelser i hela intervallet inklusive böjning, räckvidd och balansering.

DeepMind lyfte fram flera riktmärken för skicklighet. I demonstrationer visades robotar som drivs av modellen skruva i glödlampor, knyta knutar och utföra andra känsliga handlingar som kräver finmotorisk kontroll. Labbet sa att systemet uppnår en ny nivå av skicklighet som låter robotar utföra uppgifter som kräver äkta finess snarare än brutala upprepningar.

Företaget betonade också anpassningsförmåga. Gemini Robotics 2 kan anpassas till alla tvåarmsrobotar på bara några timmar, sa DeepMind, vilket innebär att samma underliggande intelligens kan skalas från en bordsarm till en komplex humanoid utan en fullständig omskolningscykel. Denna generalisering är en betydande avvikelse från konventionell robotteknik, där varje maskin vanligtvis kräver specialbyggd programvara.

Robotar som arbetar tillsammans

En annan rubrikmöjlighet är samarbete med flera robotar. DeepMind sa att Gemini Robotics 2 stöder scenarier där två robotar arbetar tillsammans på en enda uppgift och delar arbetet i ett delat fysiskt utrymme. ER 2-modellen hanterar koordineringen — resonemang om miljön, kartläggning av en flerstegssekvens och allokering av steg mellan maskiner.

I en demonstration som citerats av företaget, samarbetade ett par robotar för att städa ett rum, delade jobbet istället för att stöta på varandra. DeepMind inramade detta som ett tidigt bevis på att AI inte bara kan hantera enskilda handlingar utan orkestreringen av flera agenter i den verkliga världen.

Interaktiv och instruerbar

Utöver autonom drift är modellerna designade för att vara interaktiva. Gemini Robotics 2 kan förklara dess tillvägagångssätt medan de utför en åtgärd, och användare kan omdirigera en robot mitt i uppgiften med vardagsspråk snarare än tekniska kommandon. DeepMind sa att detta gör plattformen väl lämpad för att instruera robotar i flyktiga eller farliga miljöer där mänskliga operatörer behöver justera planer i farten.

Varför det är viktigt

Lanseringen intensifierar ett redan fullsatt humanoid-robotrace. Företag inklusive Figure, Boston Dynamics och Tesla har tävlat om att kommersialisera gång- och arbetsmaskiner, medan chiptillverkare som Nvidia har investerat mycket i simulerings- och beräkningsinfrastrukturen som fysisk AI kräver.

DeepMinds satsning är att ett enda intelligenslager för allmänt bruk – ett som resonerar om den fysiska världen som en chatbot resonerar om text – kan ersätta den skräddarsydda, smala mjukvaran som har definierat industriell robotik i decennier. Om systemet verkligen kan anpassa sig till vilken utföringsform som helst på timmar, skulle det sänka barriären för tillverkare och forskare som vill distribuera kapabla robotar utan att börja om från början varje gång.

Företaget sa att det arbetar med pålitliga hårdvarupartner för att utöka plattformen, och det publicerade ansvars- och säkerhetsdokumentation vid sidan av releasen. Frågor kvarstår om hur dessa modeller presterar utanför kontrollerade demonstrationer och hur snabbt mänsklig kontroll över hela kroppen kan översättas till pålitlig, verklig implementering.

Ändå signalerar bredden av lanseringen – helkroppsrörelse, flerstegsresonemang, effektivitet på enheten och koordinering av flera agenter i en enda produktfamilj – att Google har för avsikt att vara en primär aktör i konvergensen av stora AI-modeller och fysiska maskiner.

Ligg före AI

Robotteknikens gräns rör sig snabbt och AI Buzz Wire spårar varje större utveckling. Läs mer AI-nyheter för kontinuerlig bevakning av modellsläpp, hårdvarugenombrott och branschskiften.

Utforska den senaste AI-utvecklingen →