OpenAI lanzó GPT-Live, una nueva serie de modelos de voz para ChatGPT que pueden escuchar y hablar al mismo tiempo, lo que marca la revisión más significativa de la compañía en su experiencia de voz conversacional hasta la fecha. El lanzamiento utiliza lo que OpenAI describe como una arquitectura full-duplex, que permite a los usuarios interrumpir, hablar y conversar con el asistente de una manera que, según la compañía, se siente como una llamada telefónica real.

El lanzamiento llega junto con el lanzamiento más amplio de OpenAI de la familia de modelos GPT-5.6 esta semana, y representa un impulso para hacer que las noticias de última hora sobre IA sobre interfaces de voz se sientan menos como comandar una máquina y más como chatear con una persona.

¿Qué hace que GPT-Live sea diferente?

Los asistentes de voz tradicionales funcionan en modo semidúplex: usted habla, luego se detiene, luego el sistema procesa su solicitud y responde. La toma de turnos es rígida. GPT-Live rompe ese patrón con el procesamiento de audio full-duplex, lo que significa que el modelo puede escucharte mientras sigues hablando. Eso permite interrupciones naturales, correcciones a mitad de frase y conversaciones superpuestas, el tipo de ida y vuelta que los humanos dan por sentado pero con el que las IA de voz históricamente han luchado.

Según Reuters, los modelos GPT-Live escuchan y hablan simultáneamente, una capacidad que durante mucho tiempo ha sido un objetivo para el campo de la inteligencia artificial de voz. El enfoque elimina las pausas incómodas y los turnos forzados que han definido versiones anteriores del modo de voz de ChatGPT.

Un detalle técnico notable: cuando GPT-Live encuentra preguntas complejas, las pasa a GPT-5.5 en segundo plano. El modelo de voz maneja el flujo de la conversación en tiempo real, mientras que un modelo de razonamiento más amplio trabaja en tareas más difíciles detrás de escena y luego retroalimenta la respuesta. Esa división del trabajo, según OpenAI, mejora drásticamente la calidad de la respuesta sin sacrificar la capacidad de respuesta que hace que la conversación en tiempo real parezca natural.

Disponibilidad y precios

OpenAI está implementando nuevos modelos de voz en dos niveles:

  • GPT-Live-1: el modelo completo, disponible ahora para suscriptores de pago de ChatGPT (planes Plus, Pro y Team).
  • GPT-Live-1 mini: una versión más pequeña y liviana disponible para cuentas gratuitas de ChatGPT.

El acceso API llegará pronto, dijo OpenAI, lo que permitirá a los desarrolladores crear voz full-duplex en sus propias aplicaciones. La compañía aún no ha publicado precios detallados para la API.

El lanzamiento también incorpora la búsqueda web directamente a la conversación de voz. Como informó Search Engine Journal, GPT-Live integra la búsqueda en vivo en la voz de ChatGPT, para que los usuarios puedan preguntar sobre eventos actuales o información que cambia rápidamente y obtener respuestas basadas en resultados web nuevos sin cambiar de modo.

Un mercado competitivo de IA de voz

GPT-Live aterriza en un panorama de IA de voz cada vez más poblado. Google ha estado impulsando sus funciones de voz impulsadas por Gemini en Android y su producto Gemini Live, mientras que Apple continúa reelaborando Siri en torno a grandes modelos de lenguaje. Anthropic, el principal rival de OpenAI, ha centrado sus esfuerzos recientes en codificación agente y modelos de razonamiento en lugar de voz.

El enfoque full-duplex es hacia donde parece dirigirse la industria en general. Al permitir escuchar y hablar simultáneamente, GPT-Live reduce la latencia y elimina la mayor queja que los usuarios han tenido con los asistentes de voz: la espera. El traspaso a GPT-5.5 para consultas complejas también es una señal de que OpenAI ve la voz no como una interfaz simplificada, sino como una puerta de entrada a sus modelos más capaces.

Por qué es importante

La voz se ha tratado durante años como una interfaz secundaria basada en comandos: buena para configurar temporizadores y verificar el clima, pero menos útil para conversaciones matizadas. La apuesta de GPT-Live es que el cuello de botella nunca fue la inteligencia del modelo, sino la interfaz: obligar a los humanos a hablar en ráfagas aisladas.

Si la conversación full-duplex funciona de manera confiable a escala, cambiará la forma en que las personas interactúan con la IA en teléfonos, automóviles, parlantes inteligentes y, eventualmente, en dispositivos portátiles. También plantea preocupaciones familiares: sobre el consentimiento en dispositivos que siempre escuchan, sobre el realismo de las voces sintéticas y sobre si una conversación más natural lleva a los usuarios a confiar demasiado en las respuestas de una IA.

OpenAI no ha detallado medidas de seguridad específicas para GPT-Live más allá de sus políticas de contenido existentes, aunque la integración de búsqueda significa que el modelo ahora puede extraer información en vivo en una voz que puede ser más difícil de evaluar críticamente para los usuarios que el texto por el que pueden desplazarse hacia atrás.

¿Qué viene después?

Por ahora, GPT-Live es primero una característica de ChatGPT y luego un producto para desarrolladores. La verdadera prueba llegará con el acceso API, cuando las aplicaciones de terceros, las plataformas de servicio al cliente y los fabricantes de hardware puedan conectar la conversación full-duplex a sus propios productos. También es entonces cuando OpenAI enfrentará la presión de precios de modelos de voz de código abierto más baratos y de competidores ansiosos por igualar la función.

El lanzamiento simultáneo con el lanzamiento público de GPT-5.6 sugiere que OpenAI ve la voz y el razonamiento como dos mitades de la misma estrategia: un modelo poderoso que piensa, combinado con una interfaz que le permite hablar con él como un colega.

Manténgase por delante de la IA

Para una cobertura continua de los lanzamientos de modelos, la IA de voz y todo lo que da forma a la industria, siga los últimos desarrollos de IA en AI Buzz Wire.

Leer más noticias sobre IA →