Google envió silenciosamente dos importantes actualizaciones del modelo Gemini en 48 horas esta semana, y ambas están dirigidas directamente a los desarrolladores que crean aplicaciones de producción. Gemini 3.5 Transcribe, presentado el 26 de agosto, es el modelo de conversión de voz a texto más preciso de la compañía hasta la fecha, según el blog oficial de Google. Gemini Omni 1.1 Flash, anunciado el 27 de agosto, brinda controles de nivel profesional para video generativo, incluida la extensión de escenas de hasta 40 segundos y la ampliación de 4K. Ambos modelos están disponibles a través de la API de Gemini en Google AI Studio y la plataforma Gemini Enterprise Agent.

Gemini 3.5 Transcribe: voz a texto que se limpia después de sí mismo Para más contexto sobre esta historia, consulta nuestra cobertura de la industria de IA.

Lo que distingue a Gemini 3.5 Transcribe del reconocimiento de voz convencional, dice Google, es que convierte el audio sin formato directamente en texto pulido y formateado en lugar de una transcripción sin formato. El modelo maneja el ruido de fondo, la jerga compleja y la limpieza de la falta de fluidez de forma nativa: elimina palabras de relleno como "ums" y "ahs", resuelve autocorrecciones como "nos vemos el martes, no, miércoles" y formatea automáticamente la salida.

Los números de referencia que citó Google son notables. Según lo medido por Análisis Artificial, el modelo logra una tasa promedio de error de palabras (WER) del 4,0 por ciento para casos de uso de transmisión y del 2,6 por ciento para audio sin transmisión. En el punto de referencia multilingüe FLEURS en los principales idiomas, registra un WER del 5,50 por ciento en modo de transmisión y un 5,04 por ciento sin transmisión, lo que mejora el modelo de transcripción anterior de Google, Chirp 3. El tiempo hasta la transcripción final mejora en un 70 por ciento en comparación con Chirp 3, nuevamente según lo medido por Análisis Artificial.

El modelo se entrega en dos variantes para dos flujos de trabajo. Para aplicaciones en vivo, `gemini-3.5-transcribe-live` ofrece transmisión bidireccional continua con latencia inferior a un segundo a través de Live API, dirigida a agentes de voz y subtítulos en tiempo real. Para audio grabado (reuniones, registros de llamadas, archivos), `gemini-3.5-transcribe` ofrece atribución de orador para hasta tres oradores (con soporte para más en modo experimental) y marcas de tiempo a nivel de palabra a través de la API de Interacciones.

Otras capacidades incluyen detección y transcripción automáticas en más de 85 idiomas con manejo de acentos y dialectos, y soporte de vocabulario personalizado para que el modelo se adapte a la jerga especializada y la ortografía única. Google también le dio una especie de ojos al modelo: a través de la llamada de funciones, puede delegar tareas como la generación de imágenes o el análisis de archivos a otros modelos Gemini, una característica actualmente disponible en la aplicación Gemini en macOS.

Gemini Omni 1.1 Flash: la generación de vídeo aumenta una línea de tiempo

El segundo lanzamiento aborda la queja más común sobre el vídeo con IA: el control. Gemini Omni 1.1 Flash es una actualización centrada en la producción que hace que el video generativo sea orientable en formas que sus predecesores no lo eran, y los gerentes de producto de Google DeepMind, Anish Nangia y Alisa Fortin, describieron el lanzamiento como que hace que Omni 1.1 esté "listo para producción para uso profesional".

La extensión de la escena es la característica principal. Los desarrolladores ahora pueden continuar generando imágenes sin problemas a partir de un clip existente, con el modelo analizando hasta 10 segundos del contexto anterior, un salto con respecto a los modelos anteriores que solo hacían referencia al último segundo. Los vídeos se pueden ampliar en incrementos de 10 segundos hasta una duración acumulada de 40 segundos, lo que mejora la coherencia visual y la adherencia narrativa para historias más largas.

La actualización también agrega interpolación del primer y último cuadro, lo que permite a los desarrolladores especificar los cuadros iniciales y finales para crear movimientos de cámara y transiciones entre tomas suaves y deliberados. Para la entrega, los proyectos terminados se pueden ampliar a una resolución de 4K, mientras que un modo de vista previa de 360p permite a los creadores repetir las indicaciones de forma rápida y económica antes de comprometerse con las renderizaciones finales.

De API a superficies cotidianas

Google también está integrando ambos modelos en sus productos de consumo, que es donde se muestra su ventaja de distribución. En Android, la nueva función "Rambler" en Gboard utiliza 3.5 Transcribe para convertir pensamientos hablados en texto con buen formato mientras filtra palabras de relleno; los usuarios pueden incluso realizar ediciones por voz. El modelo también permite dictar en la aplicación Gemini en macOS, funciona junto con el contexto de la pantalla en Google Antigravity y se está integrando en Chrome.

Para los desarrolladores, los dos lanzamientos se interpretan como una sola estrategia: Google está impulsando a Gemini desde un chatbot con el que se habla a una infraestructura que ve, escucha y produce medios. Con OpenAI, ElevenLabs y una cohorte de nuevas empresas de video compitiendo en el mismo territorio, la tasa de error de palabras del 2,6 por ciento y las escenas coherentes de 40 segundos son la apuesta inicial de Google para las cargas de trabajo de producción que realmente generan ingresos: agentes de voz, canales de subtítulos y herramientas creativas. Los desarrolladores pueden comenzar a construir con ambos modelos en Google AI Studio hoy.

Por qué la tasa de error de palabras sigue siendo importante

La tasa de error de palabras suena como una estadística académica, pero en producción es la diferencia entre un producto de voz que funciona y uno que frustra. Cada expresión mal entendida en un agente de voz interrumpe una tarea: una identificación de pedido mal escuchada desencadena una búsqueda fallida, una dirección confusa envía un paquete a la ciudad equivocada. Es por eso que la brecha entre un WER del 2,6 por ciento en audio sin transmisión y las tasas altas de un solo dígito que eran comunes hace una generación de modelos se suma a una diferencia de orden de magnitud en usabilidad.

La distinción entre los dos modos que Google informó también es importante para los arquitectos. La transcripción de streaming (la cifra WER del 4,0 por ciento) cambia cierta precisión por una latencia inferior a un segundo, que requieren los casos de uso interactivos como los agentes de voz en vivo. La transcripción por lotes de audio grabado es más lenta, pero alcanza el 2,6 por ciento, razón por la cual los análisis posteriores a la llamada y el procesamiento de archivos pueden permitirse el lujo de ser más exigentes. La decisión de Google de exponer ambos como puntos finales de modelo separados en lugar de una configuración ajustable reconoce que los desarrolladores construyen productos diferentes en cada lado de esa compensación.

Un flujo de trabajo por niveles para la producción de vídeo

La actualización Omni 1.1 Flash es igualmente pragmática sobre cómo se produce realmente el trabajo creativo. La iteración del vídeo generativo ha sido costosa: cada experimento rápido significó un renderizado completo. El nuevo modo de vista previa de 360p separa la exploración de la entrega, lo que permite a los creadores recorrer las variaciones de las indicaciones de forma económica y solo pagar por la ampliación a 4K en las tomas que sobreviven a la revisión.

La mecánica de extensión de la escena aborda el problema de coherencia que ha mantenido al vídeo con IA en el gueto del tamaño de un clip. Al analizar 10 segundos de contexto anterior en lugar de solo el fotograma final, el modelo puede extender una escena en incrementos de 10 segundos hasta 40 segundos mientras mantiene consistentes los personajes, la iluminación y el estilo visual. Combinado con la interpolación del primer y último cuadro, que brinda a los editores puntos de control deterministas, la forma en que funcionan los marcadores de entrada y salida en la edición convencional, el metraje generado por IA comienza a encajar en procesos de posproducción reales en lugar de reemplazarlos por completo.

El panorama competitivo

Ambos lanzamientos posicionan a Google como una infraestructura más que como un destino. En el discurso, Google se está enfrentando a proveedores de transcripción especializados y a las pilas de voz de sus rivales en la nube al incorporar precisión de última generación en la API Gemini que sus desarrolladores ya utilizan. En video, compite en un mercado lleno de startups bien financiadas al enfatizar el control y la integración del flujo de trabajo por encima del espectáculo en bruto.

La ventaja de distribución puede ser el factor decisivo. El mismo modelo de transcripción al que los desarrolladores pueden llamar desde la API de Gemini ya impulsa el dictado Rambler de Gboard en Android, la aplicación Gemini en macOS, Google Antigravity y Chrome, lo que significa que Google puede amortizar el desarrollo del modelo a través de miles de millones de interacciones de usuarios mientras recopila el audio diverso del mundo real que lo sigue mejorando. Para los desarrolladores que elijan una pila de voz o video en 2026, ese volante ahora es parte del discurso.

---

Mantente al Día con la IA

Las últimas noticias, análisis y avances de inteligencia artificial, en un solo lugar.

Leer más noticias de IA →