Anunciado el 30 de julio de 2026, el lanzamiento se centra en un modelo de visión-lenguaje-acción (VLA) que convierte lo que un robot ve y oye en comandos motores precisos. DeepMind la describe como la capa de inteligencia para la robótica de uso general, y la compañía posicionó el lanzamiento como un punto de inflexión para sacar la IA de las ventanas de chat y llevarla al mundo físico. Para obtener más información sobre el impulso más amplio de la industria hacia la IA incorporada, siga nuestras últimas noticias sobre IA.
Tres modelos, un sistema
DeepMind envió tres modelos complementarios en la línea Gemini Robotics 2:
- Gemini Robotics 2: el modelo VLA insignia que traduce la visión y el lenguaje en control motor, permitiendo que un robot realice acciones físicas.
- Gemini Robotics ER 2: un modelo de razonamiento encarnado capaz de comprender espacios físicos y producir planos detallados de varios pasos que se coordinan con humanos y otros robots.
- Gemini Robotics On-Device 2: una versión liviana del modelo VLA optimizada para ejecutarse localmente en hardware robótico, lo que reduce la dependencia de la conectividad en la nube.
Según el blog DeepMind, cada modelo tiene una función especializada, pero el trío está diseñado para funcionar como un único sistema integrado. El modelo VLA maneja acciones en tiempo real, el modelo ER maneja planificación de nivel superior y la variante en el dispositivo permite respuestas de baja latencia en el propio robot.
De los pies a las yemas de los dedos
La afirmación más llamativa del anuncio es lo que DeepMind llama control inteligente de todo el cuerpo. En lugar de entrenar a un robot para que repita un movimiento, Gemini Robotics 2 está diseñado para comandar un cuerpo humanoide completo, desde los pies hasta las yemas de los dedos, permitiendo movimientos de rango completo similares a los humanos, como doblarse, estirarse y equilibrarse.
DeepMind destacó varios puntos de referencia de destreza. En las demostraciones, se mostró a los robots impulsados por el modelo enroscando bombillas, haciendo nudos y realizando otras acciones delicadas que requieren un control motor fino. El laboratorio dijo que el sistema alcanza un nuevo nivel de destreza que permite a los robots completar tareas que exigen delicadeza genuina en lugar de una repetición bruta.
La empresa también hizo hincapié en la adaptabilidad. Gemini Robotics 2 se puede adaptar a cualquier robot de dos brazos en solo unas pocas horas, dijo DeepMind, lo que significa que la misma inteligencia subyacente puede escalar desde un brazo de mesa hasta un humanoide complejo sin un ciclo completo de reentrenamiento. Esta generalización supone un alejamiento significativo de la robótica convencional, donde cada máquina normalmente requiere un software especialmente diseñado.
Robots trabajando juntos
Otra capacidad destacada es la colaboración entre múltiples robots. DeepMind dijo que Gemini Robotics 2 admite escenarios en los que dos robots trabajan juntos en una sola tarea, dividiendo el trabajo en un espacio físico compartido. El modelo ER 2 maneja la coordinación: razonar sobre el entorno, trazar una secuencia de varios pasos y asignar pasos entre máquinas.
En una demostración citada por la empresa, un par de robots colaboraron para limpiar una habitación, dividiendo el trabajo en lugar de chocar entre sí. DeepMind enmarcó esto como una evidencia temprana de que la IA puede gestionar no sólo acciones individuales sino también la orquestación de múltiples agentes en el mundo real.
Interactivo e instructable
Más allá del funcionamiento autónomo, los modelos están diseñados para ser interactivos. Gemini Robotics 2 puede explicar su enfoque mientras realiza una acción, y los usuarios pueden redirigir un robot a mitad de una tarea utilizando un lenguaje cotidiano en lugar de comandos técnicos. DeepMind dijo que esto hace que la plataforma sea muy adecuada para instruir a robots en entornos volátiles o peligrosos donde los operadores humanos necesitan ajustar los planes sobre la marcha.
Por qué es importante
El lanzamiento intensifica una carrera de robótica humanoide ya concurrida. Empresas como Figure, Boston Dynamics y Tesla se han apresurado a comercializar máquinas para caminar y trabajar, mientras que los fabricantes de chips como Nvidia han invertido mucho en la infraestructura de simulación y computación que requiere la IA física.
La apuesta de DeepMind es que una única capa de inteligencia de propósito general (una que razona sobre el mundo físico de la misma manera que un chatbot razona sobre el texto) puede reemplazar el software limitado y personalizado que ha definido la robótica industrial durante décadas. Si el sistema realmente puede adaptarse a cualquier realización en horas, reduciría la barrera para los fabricantes e investigadores que buscan implementar robots capaces sin tener que empezar desde cero cada vez.
La compañía dijo que está trabajando con socios de hardware confiables para expandir la plataforma y publicó documentación de responsabilidad y seguridad junto con el lanzamiento. Quedan dudas sobre cómo funcionan estos modelos fuera de las demostraciones controladas y con qué rapidez el control humanoide de todo el cuerpo puede traducirse en una implementación confiable en el mundo real.
Aún así, la amplitud del lanzamiento (movimiento de todo el cuerpo, razonamiento de múltiples pasos, eficiencia en el dispositivo y coordinación de múltiples agentes en una sola familia de productos) indica que Google pretende ser un actor principal en la convergencia de grandes modelos de IA y máquinas físicas.
Manténgase por delante de la IA
La frontera de la robótica avanza rápidamente y AI Buzz Wire sigue cada desarrollo importante. Lea más noticias sobre IA para obtener una cobertura continua de lanzamientos de modelos, avances en hardware y cambios en la industria.
Explore los últimos desarrollos de IA →