Annoncée le 30 juillet 2026, la version se concentre sur un modèle vision-langage-action (VLA) qui convertit ce qu'un robot voit et entend en commandes motrices précises. DeepMind le décrit comme la couche d'intelligence pour la robotique à usage général, et la société a positionné ce lancement comme un tournant dans la sortie de l'IA des fenêtres de discussion et dans le monde physique. Pour en savoir plus sur la poussée plus large de l'industrie vers l'IA incarnée, suivez nos dernières actualités sur l'IA.
Trois modèles, un système
DeepMind a livré trois modèles complémentaires dans la gamme Gemini Robotics 2 :
- Gemini Robotics 2 — le modèle phare de VLA qui traduit la vision et le langage en contrôle moteur, permettant à un robot d'agir physiquement.
- Gemini Robotics ER 2 — un modèle de raisonnement incarné capable de comprendre les espaces physiques et de produire des plans détaillés en plusieurs étapes qui se coordonnent avec les humains et d'autres robots.
- Gemini Robotics On-Device 2 — une version allégée du modèle VLA optimisée pour fonctionner localement sur du matériel robotique, réduisant ainsi la dépendance à l'égard de la connectivité cloud.
Selon le blog DeepMind, chaque modèle a un rôle spécialisé mais le trio est conçu pour fonctionner comme un système intégré unique. Le modèle VLA gère l'action en temps réel, le modèle ER gère la planification de niveau supérieur et la variante sur appareil permet des réponses à faible latence sur le robot lui-même.
Des pieds au bout des doigts
L’affirmation la plus frappante de l’annonce est ce que DeepMind appelle le contrôle intelligent du corps entier. Plutôt que d’entraîner un robot à répéter un mouvement, Gemini Robotics 2 est conçu pour commander un corps humanoïde entier – des pieds au bout des doigts – permettant une gamme complète de mouvements semblables à ceux d’un humain, notamment la flexion, l’atteinte et l’équilibre.
DeepMind a mis en évidence plusieurs critères de dextérité. Lors des démonstrations, des robots propulsés par le modèle ont été montrés en train de visser des ampoules, de faire des nœuds et d'effectuer d'autres actions délicates nécessitant un contrôle moteur fin. Le laboratoire a déclaré que le système atteint un nouveau niveau de dextérité qui permet aux robots d'accomplir des tâches exigeant une véritable finesse plutôt qu'une répétition brutale.
L'entreprise a également mis l'accent sur l'adaptabilité. Gemini Robotics 2 peut être adapté à n'importe quel robot à deux bras en quelques heures seulement, a déclaré DeepMind, ce qui signifie que la même intelligence sous-jacente peut passer d'un bras de table à un humanoïde complexe sans cycle de recyclage complet. Cette généralisation constitue une rupture significative avec la robotique conventionnelle, où chaque machine nécessite généralement un logiciel spécialement conçu.
Robots travaillant ensemble
Une autre fonctionnalité phare est la collaboration multi-robots. DeepMind a déclaré que Gemini Robotics 2 prend en charge les scénarios dans lesquels deux robots travaillent ensemble sur une seule tâche, se partageant le travail dans un espace physique partagé. Le modèle ER 2 gère la coordination : raisonner sur l'environnement, tracer une séquence en plusieurs étapes et répartir les étapes entre les machines.
Dans une démonstration citée par l'entreprise, deux robots ont collaboré pour nettoyer une pièce, se partageant le travail plutôt que de se heurter. DeepMind a présenté cela comme une première preuve que l’IA peut gérer non seulement des actions individuelles mais aussi l’orchestration de plusieurs agents dans le monde réel.
Interactif et instructable
Au-delà du fonctionnement autonome, les modèles sont conçus pour être interactifs. Gemini Robotics 2 peut expliquer son approche lors de l'exécution d'une action, et les utilisateurs peuvent rediriger un robot en cours de tâche en utilisant un langage courant plutôt que des commandes techniques. DeepMind a déclaré que cela rend la plate-forme bien adaptée pour instruire des robots dans des environnements volatils ou dangereux où les opérateurs humains doivent ajuster leurs plans à la volée.
Pourquoi c'est important
Le lancement intensifie une course à la robotique humanoïde déjà bondée. Des entreprises telles que Figure, Boston Dynamics et Tesla se sont précipitées pour commercialiser des machines qui fonctionnent et qui marchent, tandis que des fabricants de puces tels que Nvidia ont investi massivement dans l'infrastructure de simulation et de calcul dont a besoin l'IA physique.
Le pari de DeepMind est qu'une seule couche d'intelligence à usage général – une couche qui raisonne sur le monde physique de la même manière qu'un chatbot raisonne sur du texte – peut remplacer le logiciel étroit et sur mesure qui définit la robotique industrielle depuis des décennies. Si le système peut effectivement s’adapter à n’importe quel mode de réalisation en quelques heures, cela abaisserait la barrière pour les fabricants et les chercheurs cherchant à déployer des robots performants sans repartir de zéro à chaque fois.
La société a déclaré qu'elle travaillait avec des partenaires matériels de confiance pour étendre la plate-forme et a publié une documentation sur la responsabilité et la sécurité parallèlement à la version. Des questions demeurent quant à la façon dont ces modèles fonctionnent en dehors des démonstrations contrôlées et à la rapidité avec laquelle le contrôle humanoïde du corps entier peut se traduire par un déploiement fiable dans le monde réel.
Pourtant, l’ampleur du lancement – mouvements du corps entier, raisonnement en plusieurs étapes, efficacité sur l’appareil et coordination multi-agents dans une seule famille de produits – indique que Google a l’intention d’être un acteur majeur dans la convergence des grands modèles d’IA et des machines physiques.
Gardez une longueur d'avance sur l'IA
La frontière de la robotique évolue rapidement et AI Buzz Wire suit chaque développement majeur. En savoir plus sur l'actualité de l'IA pour une couverture continue des versions de modèles, des avancées matérielles et des changements dans l'industrie.
Explorez les derniers développements de l'IA →