Premiera, ogłoszona 30 lipca 2026 r., koncentruje się na modelu wizja-język-działanie (VLA), który przekształca to, co robot widzi i słyszy, na precyzyjne polecenia motoryczne. DeepMind opisuje to jako warstwę inteligencji dla robotyki ogólnego przeznaczenia, a firma uznała tę premierę za punkt zwrotny w wyprowadzaniu sztucznej inteligencji z okien czatu do świata fizycznego. Więcej informacji na temat szerzej zakrojonych działań branży w stronę ucieleśnionej sztucznej inteligencji znajdziesz w naszych najświeższych wiadomościach dotyczących sztucznej inteligencji.
Trzy modele, jeden system
DeepMind dostarczył trzy uzupełniające się modele w ofercie Gemini Robotics 2:
- Gemini Robotics 2 — flagowy model VLA, który przekłada wizję i język na kontrolę motoryczną, umożliwiając robotowi podejmowanie fizycznych działań.
- Gemini Robotics ER 2 — model rozumowania ucieleśnionego, zdolny do zrozumienia przestrzeni fizycznych i tworzenia szczegółowych, wieloetapowych planów, które współpracują z ludźmi i innymi robotami.
- Gemini Robotics On-Device 2 — lekka wersja modelu VLA zoptymalizowana do lokalnego działania na sprzęcie robotycznym, zmniejszająca zależność od łączności w chmurze.
Według bloga DeepMind każdy model pełni specjalistyczną rolę, ale wszystkie trzy modele zaprojektowano tak, aby działały jako pojedynczy zintegrowany system. Model VLA obsługuje działania w czasie rzeczywistym, model ER obsługuje planowanie wyższego poziomu, a wariant na urządzeniu umożliwia reakcje samego robota z niskimi opóźnieniami.
Od stóp po koniuszki palców
Najbardziej uderzającym stwierdzeniem zawartym w ogłoszeniu jest to, co DeepMind nazywa inteligentną kontrolą całego ciała. Zamiast uczyć robota powtarzania jednego ruchu, Gemini Robotics 2 zaprojektowano tak, aby sterował całym humanoidalnym ciałem – od stóp po koniuszki palców – umożliwiając wykonywanie pełnych zakresów ruchów przypominających ludzkie, w tym zginanie, sięganie i utrzymywanie równowagi.
DeepMind wyróżnił kilka testów zręcznościowych. Podczas demonstracji pokazano roboty zasilane przez modelkę, które wkręcały żarówki, wiązały węzły i wykonywały inne delikatne czynności wymagające doskonałej kontroli motorycznej. Laboratorium stwierdziło, że system osiąga nowy poziom zręczności, który pozwala robotom wykonywać zadania wymagające prawdziwej finezji, a nie brutalnego powtarzania.
Firma położyła również nacisk na zdolność adaptacji. DeepMind twierdzi, że Gemini Robotics 2 można dostosować do dowolnego robota dwuramiennego w ciągu zaledwie kilku godzin, co oznacza, że tę samą inteligencję można skalować od ramienia stołowego do złożonego humanoida bez pełnego cyklu przekwalifikowania. To uogólnienie stanowi znaczące odejście od konwencjonalnej robotyki, w której każda maszyna zazwyczaj wymaga specjalnie zaprojektowanego oprogramowania.
Roboty pracujące razem
Kolejną ważną możliwością jest współpraca wielu robotów. DeepMind twierdzi, że Gemini Robotics 2 obsługuje scenariusze, w których dwa roboty pracują razem nad jednym zadaniem, dzieląc pracę we wspólnej przestrzeni fizycznej. Model ER 2 obsługuje koordynację — rozumowanie na temat środowiska, planowanie wieloetapowej sekwencji i przydzielanie kroków między maszynami.
W jednej z demonstracji cytowanej przez firmę para robotów współpracowała przy sprzątaniu pokoju, dzieląc się pracą, zamiast wpadać na siebie. DeepMind uznał to za wczesny dowód na to, że sztuczna inteligencja może zarządzać nie tylko indywidualnymi działaniami, ale także koordynacją wielu agentów w prawdziwym świecie.
Interaktywny i łatwy do nauczenia
Oprócz działania autonomicznego, modele zaprojektowano tak, aby były interaktywne. Gemini Robotics 2 może wyjaśnić swoje podejście podczas wykonywania czynności, a użytkownicy mogą przekierowywać robota w trakcie wykonywania zadania, używając języka codziennego, a nie poleceń technicznych. DeepMind stwierdził, że dzięki temu platforma dobrze nadaje się do szkolenia robotów w niestabilnych lub niebezpiecznych środowiskach, w których operatorzy muszą na bieżąco dostosowywać plany.
Dlaczego to ma znaczenie
Wystrzelenie intensyfikuje i tak już zatłoczony wyścig humanoidów i robotów. Firmy, w tym Figura, Boston Dynamics i Tesla, ścigają się, aby komercjalizować chodzące, działające maszyny, podczas gdy producenci chipów, tacy jak Nvidia, intensywnie inwestują w infrastrukturę symulacyjną i obliczeniową wymaganą przez fizyczną sztuczną inteligencję.
DeepMind zakłada, że pojedyncza warstwa inteligencji ogólnego przeznaczenia — taka, która analizuje świat fizyczny w taki sam sposób, w jaki chatbot analizuje tekst — może zastąpić specjalnie zaprojektowane, wąskie oprogramowanie, które od dziesięcioleci definiuje robotykę przemysłową. Jeśli system rzeczywiście będzie w stanie dostosować się do dowolnego przykładu wykonania w ciągu kilku godzin, zmniejszyłoby to barierę dla producentów i badaczy chcących wdrażać zdolne roboty bez konieczności zaczynania za każdym razem od zera.
Firma oświadczyła, że współpracuje z zaufanymi partnerami sprzętowymi nad rozbudową platformy, i wraz z wydaniem opublikowała dokumentację dotyczącą odpowiedzialności i bezpieczeństwa. Pozostają pytania dotyczące tego, jak te modele radzą sobie poza kontrolowanymi demonstracjami i jak szybko sterowanie humanoidalne całym ciałem może przełożyć się na niezawodne wdrożenie w świecie rzeczywistym.
Mimo to zakres wprowadzenia na rynek – ruch całego ciała, wieloetapowe rozumowanie, wydajność na urządzeniu i koordynacja wielu agentów w ramach jednej rodziny produktów – sygnalizuje, że Google zamierza być głównym graczem w zakresie konwergencji dużych modeli sztucznej inteligencji i maszyn fizycznych.
Wyprzedź sztuczną inteligencję
Granice robotyki szybko się przesuwają, a AI Buzz Wire śledzi każdy większy rozwój. Przeczytaj więcej aktualności o sztucznej inteligencji, aby stale relacjonować premiery modeli, przełomy sprzętowe i zmiany w branży.
Poznaj najnowsze osiągnięcia AI →