Google presentó el miércoles dos nuevos modelos de conversión de texto a voz: Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, calificándolos como sus modelos de generación de audio más expresivos hasta el momento. Los modelos están disponibles en Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook y Google Vids, según el anuncio de Google de Leland Rechis, gerente de productos del grupo, y Alan Cowen, director de investigación científica del equipo de audio de Gemini.

El lanzamiento lleva la generación de voz más allá de los ajustes preestablecidos de voz estáticos hacia lo que Google describe como un estudio creativo: voces diseñadas a partir de un mensaje de texto, actuaciones dirigidas línea por línea y andamios de seguridad integrados desde el principio. Para obtener más información sobre este y otros lanzamientos, consulte nuestras noticias sobre modelos de IA.

Dos modelos, dos trabajos

La pareja divide la carga de trabajo al estilo familiar de Google. Gemini 3.8 Flash TTS está diseñado para una dirección creativa profunda y diseño de personajes, creando voces completamente nuevas desde cero a través de indicaciones en lenguaje natural para juegos, audiolibros inmersivos, podcasts y medios interactivos, con control granular sobre señales de actuación, ritmo, cambios de dialecto y backchanneling. Gemini 3.8 Flash-Lite TTS es el juego de volumen: optimizado para doblaje de alto volumen, creación de contenido de audio y agentes de voz expresivos a escala, con control detallado sobre el tono, el ritmo y los matices a menor costo.

El posicionamiento de Google enmarca a la pareja como una transformación de la generación de voz "de ajustes preestablecidos estáticos a un estudio creativo dinámico". La compañía señala los audiolibros, juegos y podcasts como destinos naturales para el modelo insignia, mientras que la variante Lite apunta al poco glamoroso pero enorme mercado de doblaje y agentes de voz siempre activos, donde el costo por minuto generado importa más que el poder de las estrellas. Ambos modelos están integrados en los productos de Google (entre ellos Gemini Notebook y Google Vids), lo que indica que la tecnología aparecerá en herramientas orientadas al consumidor en lugar de seguir siendo un juego exclusivo de API.

Un estudio vocal completo, desde 30 voces hasta el infinito

Google dice que los desarrolladores ahora pueden escalar desde 30 voces originales hasta lo que llama una biblioteca infinita. El sistema de diseño de voz generativa permite a los usuarios crear voces a medida especificando roles, acentos y características de voz en más de 100 idiomas y dialectos; las demostraciones de Google van desde una voz de DJ de alta energía de Melbourne hasta un "robot monótono súper pequeño" y un dragón japonés.

Además de la generación, los modelos se entregan con una biblioteca de más de 2000 voces listas para producción, incluidas variedades regionales como el español mexicano, el francés de Quebec y el inglés escocés.

La replicación de voz se incluye con las barreras de seguridad: los usuarios pueden recrear un perfil vocal consistente a partir de solo una muestra de audio de 30 segundos (de su propia voz o de una que tengan derecho a usar) respaldada por verificación de consentimiento incorporada, marca de agua SynthID y credenciales C2PA. Google también está agregando la funcionalidad de guardar y escalar para mantener las voces personalizadas consistentes en todos los proyectos, con la remezcla de voces (ajustar el timbre, el tono, el ritmo y el acento a través de indicaciones) próximamente.

Dirigiendo la actuación, línea por línea

Ambos modelos admiten una dirección precisa por línea. Los desarrolladores pueden escribir sus propias direcciones escénicas o dejar que el modelo dirija la entrega a partir de señales naturales del guión: la diferencia entre un agente de servicio al cliente tranquilo y una escena de suspenso susurrada. Las ráfagas vocales escritas como , y añaden textura no verbal, mientras que las interjecciones de escucha activa como |mhm| y |sí| manejar el pegamento conversacional que hace que el diálogo suene humano.

Dos características apuntan al trabajo de formato más largo y con varias voces. La generación de formato largo mantiene la calidad de la voz y el ritmo a lo largo de horas de audio continuo con una deriva mínima del hablante (dirigida a podcasts y audiolibros), mientras que la puesta en escena nativa de dos hablantes dirige conversaciones de varios turnos desde un solo guión con turnos naturales y voces claramente separadas.

Puntos de referencia: No. 1 en Hume AI

Google lidera el anuncio con números de terceros. Gemini 3.8 Flash TTS ocupó el puesto número 1 en general en el Benchmark de diseño de voz de Hume AI con una puntuación de 71,4 y lidera el modelado de acento con 60,8. En el índice de calidad general de Hume AI, los dos nuevos modelos ocupan los puestos número 1 y 2 respectivamente.

Las afirmaciones comparativas del proveedor siempre deben leerse con cierta precaución, pero Hume AI, una empresa independiente de investigación de inteligencia artificial de voz, es un árbitro razonable para la calidad del habla, y los puntajes le dan a Google un tema de conversación concreto frente a sus rivales en generación de voz.

La carrera armamentista del audio continúa

Los nuevos modelos se unen a una familia de audio Gemini de rápido crecimiento que ya incluye 3.5 Live Translate, 3.5 Transcribe, 3.8 Live y 3.8 Live Extended Thinking: los modelos de voz en tiempo real que Google lanzó a principios de este mes. La cadencia no es accidental: la síntesis de voz expresiva y confiable se está convirtiendo en la infraestructura central para los agentes de voz, la atención al cliente, las herramientas de accesibilidad y la producción de medios, y Google quiere que Gemini sea la capa predeterminada para todo ello.

Para los desarrolladores, la conclusión inmediata es más práctica que futurista: voces de marca personalizadas, doblaje multilingüe y narraciones de horas de duración ahora están a un paso de distancia dentro de la API de Gemini y AI Studio, con marcas de agua adjuntas.

La economía decidirá cuánto de ese potencial se utilizará. Google no ha enfatizado el precio en los materiales de lanzamiento, pero la existencia de un nivel Flash-Lite implica una opción deliberada de bajo costo para cargas de trabajo masivas, reflejando la estrategia de niveles que aplica en toda la familia de modelos Gemini. Las empresas de Gemini Enterprise obtienen las mismas capacidades detrás de sus acuerdos existentes, que es donde Google espera que aterrice la mayor parte de la producción de audio de alto volumen.

Lo que queda por ver es qué tan rápido las industrias creativas adoptan la narración sintetizada. Las marcas de agua y la verificación del consentimiento reducen las barreras legales y éticas, y las cifras de referencia sugieren que la calidad ya no es el cuello de botella. Si las afirmaciones de Google se mantienen en la práctica, la brecha entre una voz en off humana grabada y una generada es ahora lo suficientemente estrecha como para que el costo y el tiempo de entrega (no la autenticidad) tomen la decisión en la mayoría de los proyectos.

---

Manténgase a la vanguardia de la IA

Obtenga las últimas noticias, análisis y avances en IA, todo en un solo lugar.

Leer más noticias sobre IA →