Google DeepMind ha convertido el uso de computadoras en una herramienta integrada dentro de Gemini 3.5 Flash, brindando a los desarrolladores una forma nativa de crear agentes de inteligencia artificial que pueden interactuar con software en todas las plataformas sin necesidad de utilizar marcos de trabajo de terceros.
El anuncio, publicado el 24 de junio de 2026 en el blog oficial de palabras clave de Google, posiciona a Gemini 3.5 Flash como un competidor en el mercado en rápido movimiento de agentes que pueden ver una pantalla, mover un cursor, hacer clic y escribir, capacidades que hasta hace poco requerían una importante ingeniería personalizada. Para más contexto sobre esta historia, consulta nuestra últimos avances en IA.
"El uso de la computadora es ahora una herramienta incorporada en Gemini 3.5 Flash para crear agentes que puedan interactuar entre plataformas", escribió la compañía. La publicación fue escrita por Mateo Quirós, gerente de producto de Google DeepMind.
Cómo funciona
El uso de la computadora permite que un modelo opere una computadora de manera muy similar a como lo haría un humano: interpretando lo que está en la pantalla y realizando acciones como hacer clic, desplazarse e ingresar texto. Al integrar la capacidad directamente en Gemini 3.5 Flash en lugar de ofrecerla como un producto separado, Google está reduciendo la barrera para los desarrolladores que desean crear agentes que naveguen por aplicaciones, sitios web y sistemas operativos reales.
Según la publicación del blog, los desarrolladores y las empresas pueden comenzar a utilizar computadoras en 3.5 Flash a través de la API Gemini y la plataforma Gemini Enterprise Agent, el entorno dedicado de Google para crear e implementar agentes a escala.
Google demostró su capacidad con casos de uso concretos. En un ejemplo, Gemini 3.5 Flash utilizó el uso de la computadora para analizar la aplicación Gemini y devolver una lista categorizada de funciones. En otro, el modelo auditó su propia documentación en busca de problemas de accesibilidad, una tarea autorreferencial que da pistas de cómo los agentes que usan computadoras podrían algún día ayudar a mantener los ecosistemas de software en los que se ejecutan.
Seguridad: entrenamiento adversario y un enfoque de 'defensa en profundidad'
La parte más importante del comunicado puede ser lo que dijo Google sobre la seguridad. Los agentes que operan en entornos en vivo son especialmente vulnerables a la inyección rápida: ataques en los que instrucciones ocultas incrustadas en una página web, correo electrónico o documento secuestran al agente para que realice acciones no deseadas.
Google dijo que utilizó entrenamiento adversario específico para el uso de computadoras en Gemini 3.5 Flash para mitigar esos riesgos. También está lanzando dos sistemas de protección empresarial opcionales que, según la compañía, permiten a las organizaciones controlar mejor lo que pueden hacer sus agentes.
Adoptando un enfoque de "defensa en profundidad", Google alentó a los desarrolladores a combinar estas funciones con un espacio aislado seguro, verificación humana en el circuito y controles de acceso estrictos. La compañía publicó orientación adicional en su documentación de mejores prácticas para la función.
Ese encuadre importa. El uso de computadoras se considera ampliamente como una de las capacidades de agente más peligrosas de implementar, porque un agente comprometido puede realizar acciones del mundo real dentro de las cuentas y sistemas de un usuario. Al liderar con entrenamiento de confrontación y salvaguardias en capas, Google está tratando de tranquilizar a los compradores empresariales que han dudado en entregar el control de un cursor a una IA.
Por qué el uso de la computadora se está convirtiendo en un campo de batalla
El uso de computadoras con Gemini 3.5 Flash llega cuando los principales laboratorios de inteligencia artificial compiten por crear agentes que puedan realizar un trabajo útil en lugar de simplemente responder preguntas. Anthropic introdujo una herramienta de uso informático para Claude a finales de 2024, y los productos de operador y agente de OpenAI han avanzado en la misma dirección. Hacer que la capacidad sea nativa de un modelo rápido y rentable como Flash, en lugar de reservarla para un nivel premium, indica que Google quiere mercantilizar rápidamente el control de los agentes.
La elección de Flash es en sí misma notable. Flash es el modelo de nivel de eficiencia de Google, optimizado para velocidad y costo. Incorporar el uso de computadoras allí, en lugar de solo en el modelo Pro más grande, sugiere que Google espera cargas de trabajo de agentes de gran volumen y sensibles a la latencia, del tipo que automatiza tareas repetitivas en todo el software empresarial a escala.
Google dijo que ya está viendo que los clientes generan valor con el uso de computadoras, aunque la publicación del blog no nombró implementaciones comerciales específicas ni cuantificó los resultados.
Lo que está en juego competitivo
Para los desarrolladores, el atractivo de una herramienta de uso informático integrada es sencillo: menos integraciones que mantener y un único proveedor responsable tanto del modelo como de la capa agente. Pero también profundiza la dependencia de la plataforma de Google, una compensación que las empresas sopesarán frente a la flexibilidad de los marcos de agentes independientes del modelo.
La publicación también agudiza una tensión más amplia en la economía agente. Las puertas de enlace de agentes de código abierto desarrolladas de forma independiente, como el marco Lightport que hace que múltiples proveedores de LLM sean compatibles con OpenAI, muestran cuánta demanda existe de infraestructura de agentes portátiles. La apuesta de Google es que una herramienta de uso informático propia y reforzada con seguridad conquistará a los desarrolladores que de otro modo unirían herramientas de terceros. A medida que los modelos adquieren la capacidad de actuar en pantallas, la línea entre un asistente de IA y un operador autónomo se vuelve borrosa, al igual que la línea entre un avance en productividad y un problema de seguridad. La respuesta de Google a esa tensión son las salvaguardias en capas y el entrenamiento de confrontación. Si eso es suficiente para satisfacer a las empresas reacias al riesgo determinará la rapidez con la que los agentes que utilizan computadoras pasen de las demostraciones al uso diario.
Con Gemini 3.5 Flash, Google ha hecho una apuesta clara: el futuro de la IA no son sólo modelos que respondan, sino modelos que actúen, y quiere que los desarrolladores construyan esos modelos de actuación en su plataforma.
---
Mantente al Día con la IALas últimas noticias, análisis y avances de inteligencia artificial, en un solo lugar.
Leer más noticias de IA →


