Google lanzó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, un par de modelos de diálogo en vivo que la compañía describe como los más avanzados hasta el momento para conversaciones de voz naturales. Los modelos comenzaron a implementarse el 15 de septiembre en Gemini API, Google AI Studio, Search Live, Gemini Live y Google Workspace, con acceso empresarial en vista previa privada a través de Gemini Enterprise.
El anuncio provino de Tom Ouyang, ingeniero principal, y Malini Jaganathan, miembro del personal técnico, que escribieron en nombre del equipo de Gemini Audio. Amplía la familia Gemini 3.8 que debutó a principios de este mes con los modelos Flash y Flash Cyber, y marca el impulso más agresivo de Google hasta ahora hacia la asistencia de voz multimodal en tiempo real, un mercado donde el modo de voz de OpenAI y una ola de nuevas empresas de voz compiten por el mismo caso de uso diario.
El lanzamiento encaja en un tramo notablemente concurrido para la línea de modelos de Google; La cobertura de [los últimos desarrollos de IA] (https://aibuzzwire.news) muestra que la compañía ahora ha realizado envíos repetidos en el lapso de unas pocas semanas mientras lucha contra rivales en precios, codificación y ahora voz.
Creado para conversaciones en tiempo real
Lo que distingue a los modelos Live de un modelo de chat estándar con micrófono adjunto es la latencia y el estado. La documentación Live API de Google describe una interfaz de baja latencia que procesa flujos continuos de audio, imágenes y texto a través de una conexión WebSocket con estado, aceptando audio PCM sin formato de 16 kHz, imágenes JPEG de hasta un fotograma por segundo y texto, y devuelve audio hablado en tiempo real.
Los modelos procesan información visual casi en tiempo real, permitiendo que el asistente vea lo que ve el usuario: los videos de demostración de Google muestran a Gemini 3.8 Live guiando una sesión de incorporación de empleados usando contexto visual, jugando ajedrez casi en tiempo real y construyendo planes de negocios completos y kits de herramientas de marketing personalizados a través del habla natural. Los modelos también pueden detectar y realizar la transición entre 97 idiomas admitidos automáticamente, en mitad de una conversación, sin que el usuario cambie la configuración.
Quizás lo más significativo para el uso práctico: los modelos ejecutan herramientas y llamadas API en segundo plano mientras continúa la conversación, reconociendo solicitudes y manteniendo el diálogo mientras finalizan las tareas. Eso convierte al asistente de un encuestado estrictamente por turnos en algo más cercano a un agente que habla.
Los números que Google está promocionando
Google informa que Gemini 3.8 Live Extended Thinking capturó la primera posición general en el índice de calidad de voz a voz de Artificial Analysis con una puntuación de 82,6. En cuanto a la finalización de tareas de agente, la compañía cita un 68,6 % en el punto de referencia de τ-Voice y un 35,1 % en la evaluación de banca de τ-Voice de Sierra, junto con una puntuación de 97,7 % en Big Bench Audio.
Esas son las cifras reportadas por Google, y la verificación independiente llevará tiempo, pero el reclamo de estar en la cima de la tabla de Análisis Artificial, si se mantiene, colocaría a Google por delante de las ofertas optimizadas para voz de OpenAI y compañías dedicadas a IA de voz en cuanto a la calidad general de la conversación. Google también dice que Extended Thinking mantiene un precio altamente competitivo, un guiño implícito a la presión de precios que ha definido la generación 3.8.
Todo el audio generado por los modelos tiene una marca de agua con SynthID, la marca de agua imperceptible de Google, por lo que el habla generada por IA sigue siendo detectable, una protección de cumplimiento y desinformación que se está convirtiendo en estándar en todos los productos generativos de Google.
Dónde puedes usarlo
La disponibilidad difiere entre los dos modelos. Gemini 3.8 Live está disponible para todos dentro de Search Live, el modo de búsqueda visual en tiempo real de Google. Extended Thinking está disponible en Gemini Live, en Docs para los suscriptores de Google AI Pro y Ultra a través de Workspace, y en Gmail y Keep para todos los usuarios de Google.
Los desarrolladores obtienen los modelos a través de Gemini API y Google AI Studio, y Google dice que Live API ya es utilizado por plataformas como Agora, Fishjam, LiveKit, Pipecat, Vercel y Vision Agents para construir interfaces controladas por voz sobre la infraestructura en tiempo real de Google. Salesforce, Genspark y Lumeris son nombrados socios de lanzamiento de los nuevos modelos.
Un mercado de IA de voz abarrotado
La voz se está convirtiendo en el campo de batalla de las interfaces en 2026 porque es donde la IA finalmente escapa del teclado. Un modelo que puede ver, escuchar, cambiar de idioma y ejecutar herramientas mientras habla no compite con otros chatbots sino con la llamada telefónica, la línea de atención al cliente y el asistente personal.
La ventaja de Google es la distribución: Search, Android, Workspace y Chrome dan a los modelos Live una base instalada que ningún rival puede igualar. La compañía apuesta a que estar presente en cada rincón del día a día de un usuario (ahora con sus mejores modelos de voz) será más importante que cualquier victoria en un benchmark. Los rivales tendrán la oportunidad de responder, pero Google ha dejado claro que la voz, que alguna vez fue una función de demostración, ahora es una línea de productos de primera clase.
Para los desarrolladores, el mensaje es igualmente directo. Al publicar formatos de entrada exactos, documentar la ejecución de herramientas en segundo plano y sembrar el ecosistema con plataformas Live API, Google está tratando de hacer de su pila el sustrato predeterminado para cualquiera que cree interfaces habladas, desde robots de atención al cliente hasta asistentes portátiles. Si las afirmaciones de calidad de Gemini 3.8 Live se mantienen en pruebas independientes, la cuestión de la disponibilidad ya está en marcha.
---
Manténgase a la vanguardia de la IAObtenga las últimas noticias, análisis y avances en IA, todo en un solo lugar.
Leer más noticias sobre IA →