Die am 30. Juli 2026 angekündigte Veröffentlichung konzentriert sich auf ein Vision-Language-Action-Modell (VLA), das das, was ein Roboter sieht und hört, in präzise Motorbefehle umwandelt. DeepMind beschreibt es als die Intelligenzschicht für allgemeine Robotik, und das Unternehmen positionierte die Einführung als Wendepunkt bei der Einführung von KI aus Chatfenstern in die physische Welt. Weitere Informationen zum breiteren Vorstoß der Branche in Richtung verkörperter KI finden Sie in unseren aktuellen KI-Nachrichten.
Drei Modelle, ein System
DeepMind hat drei ergänzende Modelle der Gemini Robotics 2-Reihe ausgeliefert:
- Gemini Robotics 2 – das Flaggschiff-VLA-Modell, das Vision und Sprache in Motorsteuerung übersetzt und es einem Roboter ermöglicht, physische Aktionen auszuführen.
- Gemini Robotics ER 2 – ein Modell des verkörperten Denkens, das in der Lage ist, physische Räume zu verstehen und detaillierte, mehrstufige Pläne zu erstellen, die mit Menschen und anderen Robotern koordiniert werden.
- Gemini Robotics On-Device 2 – eine leichtgewichtige Version des VLA-Modells, die für die lokale Ausführung auf Roboterhardware optimiert ist und so die Abhängigkeit von Cloud-Konnektivität verringert.
Laut dem DeepMind-Blog hat jedes Modell eine spezielle Rolle, aber das Trio ist so konzipiert, dass es als ein einziges integriertes System funktioniert. Das VLA-Modell übernimmt Echtzeitaktionen, das ER-Modell übernimmt die Planung auf höherer Ebene und die On-Device-Variante ermöglicht Reaktionen mit geringer Latenz auf dem Roboter selbst.
Von den Füßen bis zu den Fingerspitzen
Die auffälligste Behauptung in der Ankündigung ist das, was DeepMind als intelligente Ganzkörperkontrolle bezeichnet. Anstatt einem Roboter beizubringen, eine Bewegung zu wiederholen, ist Gemini Robotics 2 darauf ausgelegt, einen gesamten humanoiden Körper zu steuern – von den Füßen bis zu den Fingerspitzen – und so menschenähnliche Bewegungen in vollem Umfang zu ermöglichen, einschließlich Beugen, Strecken und Balancieren.
DeepMind hob mehrere Geschicklichkeits-Benchmarks hervor. In Demonstrationen wurde gezeigt, wie Roboter, die von dem Modell angetrieben wurden, Glühbirnen einschraubten, Knoten knüpften und andere heikle Aktionen ausführten, die eine Feinmotorik erfordern. Das Labor sagte, das System erreiche ein neues Maß an Geschicklichkeit, das es Robotern ermögliche, Aufgaben zu erledigen, die echte Finesse statt brutaler Wiederholung erfordern.
Das Unternehmen legte außerdem Wert auf Anpassungsfähigkeit. Laut DeepMind kann Gemini Robotics 2 in nur wenigen Stunden an jeden Zweiarmroboter angepasst werden, was bedeutet, dass die gleiche zugrunde liegende Intelligenz ohne einen vollständigen Umschulungszyklus von einem Tischarm zu einem komplexen Humanoiden skaliert werden kann. Diese Verallgemeinerung stellt eine deutliche Abkehr von der konventionellen Robotik dar, bei der jede Maschine typischerweise eine speziell entwickelte Software benötigt.
Roboter arbeiten zusammen
Eine weitere Schlüsselfunktion ist die Zusammenarbeit mehrerer Roboter. Laut DeepMind unterstützt Gemini Robotics 2 Szenarien, in denen zwei Roboter gemeinsam an einer einzigen Aufgabe arbeiten und dabei die Arbeit in einem gemeinsamen physischen Raum aufteilen. Das ER 2-Modell übernimmt die Koordination – Überlegungen zur Umgebung, die Abbildung einer mehrstufigen Sequenz und die Zuweisung von Schritten zwischen Maschinen.
In einer vom Unternehmen zitierten Demonstration arbeiteten zwei Roboter zusammen, um einen Raum zu säubern, wobei sie sich die Arbeit aufteilten, anstatt aufeinanderzustoßen. DeepMind bezeichnete dies als ersten Beweis dafür, dass KI nicht nur einzelne Aktionen, sondern auch die Orchestrierung mehrerer Agenten in der realen Welt verwalten kann.
Interaktiv und lehrreich
Über den autonomen Betrieb hinaus sind die Modelle interaktiv konzipiert. Gemini Robotics 2 kann seine Vorgehensweise beim Ausführen einer Aktion erklären, und Benutzer können einen Roboter während der Aufgabe mithilfe der Alltagssprache anstelle technischer Befehle umleiten. Laut DeepMind eignet sich die Plattform dadurch gut für die Unterweisung von Robotern in volatilen oder gefährlichen Umgebungen, in denen menschliche Bediener ihre Pläne im Handumdrehen anpassen müssen.
Warum es wichtig ist
Der Start intensiviert ein bereits überfülltes Rennen zwischen Humanoiden und Robotern. Unternehmen wie Figure, Boston Dynamics und Tesla liefern sich einen Wettlauf um die Kommerzialisierung laufender Arbeitsmaschinen, während Chiphersteller wie Nvidia stark in die Simulations- und Recheninfrastruktur investiert haben, die für physische KI erforderlich ist.
DeepMind geht davon aus, dass eine einzige, universelle Intelligenzschicht – eine, die über die physische Welt auf die gleiche Weise argumentiert wie ein Chatbot über Text – die maßgeschneiderte, engstirnige Software ersetzen kann, die seit Jahrzehnten die Industrierobotik definiert. Wenn sich das System tatsächlich innerhalb von Stunden an jede beliebige Ausführungsform anpassen kann, würde dies die Hürde für Hersteller und Forscher senken, die leistungsfähige Roboter einsetzen möchten, ohne jedes Mal bei Null anfangen zu müssen.
Das Unternehmen sagte, es arbeite mit vertrauenswürdigen Hardware-Partnern zusammen, um die Plattform zu erweitern, und veröffentlichte zusammen mit der Veröffentlichung eine Dokumentation zu Verantwortung und Sicherheit. Es bleiben Fragen offen, wie diese Modelle außerhalb kontrollierter Demonstrationen funktionieren und wie schnell sich die humanoide Ganzkörpersteuerung in einen zuverlässigen Einsatz in der realen Welt umsetzen lässt.
Dennoch signalisiert die Breite der Einführung – Ganzkörperbewegung, mehrstufiges Denken, Effizienz auf dem Gerät und Koordination mehrerer Agenten in einer einzigen Produktfamilie –, dass Google beabsichtigt, ein Hauptakteur bei der Konvergenz großer KI-Modelle und physischer Maschinen zu sein.
Bleiben Sie der KI immer einen Schritt voraus
Die Robotik-Grenze schreitet schnell voran und AI Buzz Wire verfolgt jede wichtige Entwicklung. Lesen Sie weitere KI-Neuigkeiten für eine kontinuierliche Berichterstattung über Modellveröffentlichungen, Hardware-Durchbrüche und Branchenveränderungen.
Entdecken Sie die neuesten KI-Entwicklungen →