Google ha lanzado Gemini 3.5 Transcribe, un nuevo modelo de voz a texto creado para la transcripción en tiempo real que reconoce más de 85 idiomas automáticamente y pule la salida a lo largo del camino, eliminando palabras de relleno y corrigiendo tropiezos verbales sin que se lo pidan.

El lanzamiento posiciona la pila de voz de Google como un desafío directo en el mercado de transcripción de rápido crecimiento, donde la precisión y la latencia deciden cada vez más qué servicios adoptan los desarrolladores para llamadas, reuniones, subtítulos e interfaces de voz. Para más contexto sobre esta historia, consulta nuestra actualidad de inteligencia artificial.

Qué puede hacer el modelo

Según el anuncio de Google, cuya cobertura fue publicada por The Decoder, Gemini 3.5 Transcribe va mucho más allá de convertir palabras habladas en texto:

  • Detección automática de idioma en más de 85 idiomas, sin necesidad de configuración
  • Eliminación de palabras de relleno, limpieza de "um", "uh" y disfluencias similares
  • Corrección de errores de lengua, produciendo prosa legible en lugar de ruido palabra por palabra
  • Formato de texto autónomo, incluida la puntuación y la estructura

La compañía informa una tasa de error de palabras del 4,0 por ciento para transmisión de audio y del 2,6 por ciento para audio grabado, junto con reducciones de latencia de aproximadamente el 70 por ciento en comparación con su predecesor, Chirp 3: un margen sustancial en escenarios de subtítulos en vivo donde el retraso interrumpe las conversaciones.

Dos interfaces para dos trabajos

Los desarrolladores obtienen acceso a través de dos interfaces de programación de aplicaciones distintas:

API en vivo: `gemini-3.5-transcribe-live`

Maneja la transmisión en tiempo real con muy baja latencia, centrándose en subtítulos en vivo, agentes de voz y asistentes interactivos donde el tiempo de respuesta es más importante.

API de interacciones: `gemini-3.5-transcribe`

Procesa audio grabado y devuelve transcripciones con atribución del orador y marcas de tiempo: el flujo de trabajo típico de reuniones, entrevistas, podcasts y posproducción de medios.

Más allá de la transcripción, el modelo admite llamadas a funciones, lo que significa que puede delegar tareas de seguimiento a otros modelos de la familia Gemini, por ejemplo, activar una solicitud de generación de imágenes o una búsqueda en la web basada en algo dicho durante una sesión. Eso convierte un motor de transcripción en una capa de interfaz controlable para aplicaciones controladas por voz.

Ya se realizan envíos a todos los productos de Google

El modelo está disponible en Google AI Studio y en la Plataforma de agente empresarial Gemini para desarrolladores hoy. Google también lo ha conectado a las superficies de los consumidores: Gboard en Android lo usa a través de un componente interno llamado Rambler para el dictado, la aplicación Gemini en macOS lo aplica a la entrada de voz y está previsto que le siga la integración con Chrome.

Esa distribución importa. El reconocimiento de voz se mantiene a escala e incorporar el modelo en teclados, aplicaciones de escritorio y navegadores lo coloca frente a miles de millones de interacciones de entrada diariamente, al tiempo que alimenta los ciclos de evaluación necesarios para mantener las tasas de error cayendo en acentos, dialectos y entornos ruidosos.

Lo que está en juego en la IA del habla

La transcripción se ha convertido silenciosamente en un campo de batalla competitivo tanto entre los laboratorios de vanguardia como entre los proveedores especializados. La comprensión del habla precisa y de baja latencia es el boleto de entrada para productos de agencia que actúan según comandos hablados, inteligencia de reuniones empresariales, funciones de accesibilidad y automatización del servicio al cliente multilingüe.

Al combinar mejoras agresivas de latencia con resultados autocorregibles, Google apuesta a que los desarrolladores prefieran transcripciones que se lean como texto editado en lugar de captura fonética sin formato, intercambiando una estricta fidelidad palabra por palabra por usabilidad. Los equipos que necesitan registros exactos, como los transcriptores legales o médicos, aún pueden querer modos textuales; para todos los demás, la diferencia práctica entre escuchar a alguien y comprenderlo continúa estrechándose.

Con Gemini 3.5 Transcribe ahora disponible de forma generalizada en AI Studio y herramientas empresariales, la primera prueba significativa serán las métricas de adopción por parte de los desarrolladores de agentes de voz, un segmento de mercado que crece lo suficientemente rápido como para que incluso las ganancias incrementales de precisión se traduzcan en decisiones de cambio considerables.

Por qué la latencia es el verdadero campo de batalla

Las tasas de error acaparan los titulares, pero la latencia determina silenciosamente qué productos son viables. Un motor de transcripción que alimenta una superposición de subtítulos en vivo debe seguir el ritmo de la conversación, o los espectadores se desconectarán. Un agente de voz que negocia una llamada de atención al cliente no puede hacer una pausa incómoda mientras su capa de voz se pone al día. La reducción del 70 por ciento en el retraso reportada por Google en relación con Chirp 3 apunta precisamente a esa brecha: acortar la distancia entre un hablante que termina una oración y los sistemas posteriores que actúan sobre ella.

Para las aplicaciones de agentes, esto se agrava: cada paso de un diálogo hablado implica reconocimiento, razonamiento y respuesta. Reducir milisegundos de la etapa de reconocimiento les da a los constructores margen para gastar en modelos de razonamiento más capaces (y más lentos) sin violar los presupuestos de tiempo conversacional.

La compensación literal

Una elección de diseño merece un escrutinio. De forma predeterminada, Gemini 3.5 Transcribe selecciona la salida: las palabras de relleno desaparecen, los errores se corrigen y el formato se aplica automáticamente. Para la mayoría de los usos comerciales (minutos, subtítulos, archivos con capacidad de búsqueda), eso es exactamente lo que quieren los usuarios.

Pero ciertos flujos de trabajo dependen de registros textuales. Las declaraciones legales, las revisiones de cumplimiento y la verificación de hechos periodísticos a veces requieren saber con precisión lo que se dijo, incluidas las vacilaciones. Las organizaciones de industrias reguladas querrán tener claridad sobre qué parte de la suavización es opcional y configurable antes de migrar tuberías sensibles al nuevo modelo. La documentación de Google y los parámetros API establecerán efectivamente dónde se ubica la línea palabra por palabra versus pulida para la industria.

Una huella multilingüe como foso

La cobertura de más de 85 idiomas con detección automática no es sólo un elemento de la lista de verificación de funciones. El alcance multilingüe concentra valor en mercados donde los competidores históricamente están rezagados: los acentos regionales, el cambio de código entre idiomas a mitad de frase y los idiomas de bajos recursos castigan a los modelos entrenados estrechamente en corpus con mucho inglés.

Para las empresas globales que ejecutan centros de soporte en docenas de países, un modelo único que maneja la detección de idiomas de manera transparente reduce la complejidad de la integración: una canalización en lugar de muchas configuraciones por mercado. Combinado con la distribución a través de los miles de millones de instalaciones de Android de Gboard, Google está posicionando el multilingüismo con calidad de transcripción como una infraestructura en lugar de una capacidad premium.

Qué mirar

Tres señales mostrarán si Gemini 3.5 Transcribe cambia la cuota de mercado o simplemente aumenta las expectativas: la migración de los desarrolladores en los puntos de referencia de terceros en los próximos meses; la rapidez con la que los rivales igualan los números de latencia en lugar de las afirmaciones de precisión; y si los ganchos de llamada de funciones generan una ola de agentes de voz creados de forma nativa en Gemini. El lanzamiento ya está disponible y los niveles de precios a través de AI Studio deberían hacer que la experimentación sea lo suficientemente barata como para que los costos de cambio caigan a casi nada.

---

Mantente al Día con la IA

Las últimas noticias, análisis y avances de inteligencia artificial, en un solo lugar.

Leer más noticias de IA →