A OpenAI lançou GPT-Live, uma nova série de modelos de voz para ChatGPT que podem ouvir e falar ao mesmo tempo, marcando a revisão mais significativa da empresa em sua experiência de voz conversacional até o momento. O lançamento usa o que a OpenAI descreve como uma arquitetura full-duplex, permitindo que os usuários interrompam, conversem e conversem com o assistente de uma forma que a empresa diz parecer um telefonema real.

O lançamento chega junto com o lançamento mais amplo da família de modelos GPT-5.6 da OpenAI esta semana e representa um impulso para fazer com que as notícias de última hora sobre IA sobre interfaces de voz pareçam menos com comandar uma máquina e mais com conversar com uma pessoa.

O que torna o GPT-Live diferente

Os assistentes de voz tradicionais operam em modo half-duplex: você fala, depois para, então o sistema processa sua solicitação e responde. A tomada de turnos é rígida. O GPT-Live quebra esse padrão com processamento de áudio full-duplex, o que significa que o modelo pode ouvi-lo enquanto ainda está falando. Isso permite interrupções naturais, correções no meio de frases e conversas sobrepostas – o tipo de vaivém que os humanos consideram natural, mas com o qual as IAs de voz têm historicamente lutado.

De acordo com a Reuters, os modelos GPT-Live ouvem e falam simultaneamente – uma capacidade que há muito tempo é alvo do campo de IA de voz. A abordagem elimina as pausas estranhas e a alternância forçada que definiram as versões anteriores do modo de voz do ChatGPT.

Um detalhe técnico notável: quando o GPT-Live encontra questões complexas, ele as transfere para o GPT-5.5 em segundo plano. O modelo de voz lida com o fluxo da conversa em tempo real, enquanto um modelo de raciocínio mais amplo trabalha em tarefas mais difíceis nos bastidores – e então retorna a resposta. Essa divisão de trabalho, de acordo com a OpenAI, melhora drasticamente a qualidade da resposta sem sacrificar a capacidade de resposta que faz com que a conversa em tempo real pareça natural.

Disponibilidade e preços

A OpenAI está lançando os novos modelos de voz em dois níveis:

  • GPT-Live-1 — o modelo completo, disponível agora para assinantes pagantes do ChatGPT (planos Plus, Pro e Team).
  • GPT-Live-1 mini — uma versão menor e mais leve disponível para contas ChatGPT gratuitas.
O acesso à API estará disponível em breve, disse a OpenAI, o que permitirá aos desenvolvedores incorporar voz full-duplex em seus próprios aplicativos. A empresa ainda não publicou preços detalhados para a API.

O lançamento também traz a pesquisa na web diretamente para a conversa por voz. Conforme relatado pelo Search Engine Journal, o GPT-Live integra pesquisa ao vivo à voz do ChatGPT, para que os usuários possam perguntar sobre eventos atuais ou informações que mudam rapidamente e obter respostas baseadas em novos resultados da web sem mudar de modo.

Um mercado competitivo de IA de voz

GPT-Live chega a um cenário de IA de voz cada vez mais lotado. O Google tem promovido seus recursos de voz com tecnologia Gemini no Android e em seu produto Gemini Live, enquanto a Apple continua a reformular o Siri em torno de grandes modelos de linguagem. A Anthropic, principal rival da OpenAI, concentrou seus esforços recentes na codificação de agentes e em modelos de raciocínio, em vez de voz.

A abordagem full-duplex é para onde a indústria mais ampla parece estar se dirigindo. Ao permitir ouvir e falar simultaneamente, o GPT-Live reduz a latência e elimina a maior reclamação que os usuários têm com os assistentes de voz: a espera. A transferência para GPT-5.5 para consultas complexas também é um sinal de que a OpenAI vê a voz não como uma interface simplificada, mas como uma porta de entrada para seus modelos mais capazes.

Por que é importante

A voz foi tratada durante anos como uma interface secundária orientada por comandos – boa para definir temporizadores e verificar o tempo, mas menos útil para conversas diferenciadas. A aposta do GPT-Live é que o gargalo nunca foi a inteligência do modelo, mas a interface: forçar os humanos a falar em explosões isoladas.

Se a conversa full-duplex funcionar de forma confiável em grande escala, isso mudará a forma como as pessoas interagem com a IA em telefones, carros, alto-falantes inteligentes e, eventualmente, em dispositivos vestíveis. Também levanta preocupações familiares – sobre o consentimento em dispositivos que estão sempre atentos, sobre o realismo das vozes sintéticas e sobre se uma conversa mais natural leva os utilizadores a confiar excessivamente nas respostas de uma IA.

A OpenAI não detalhou medidas de segurança específicas para GPT-Live além de suas políticas de conteúdo existentes, embora a integração de pesquisa signifique que o modelo agora pode extrair informações ao vivo em uma voz que pode ser mais difícil para os usuários avaliarem criticamente do que o texto que eles podem percorrer.

O que vem a seguir

Por enquanto, GPT-Live é primeiro um recurso ChatGPT e depois um produto de desenvolvedor. O verdadeiro teste chegará com o acesso à API, quando aplicativos de terceiros, plataformas de atendimento ao cliente e fabricantes de hardware puderem conectar conversas full-duplex em seus próprios produtos. É também nesse momento que a OpenAI enfrentará pressão de preços de modelos de voz de código aberto mais baratos e de concorrentes ansiosos por igualar o recurso.

O lançamento simultâneo com o lançamento público do GPT-5.6 sugere que a OpenAI vê a voz e o raciocínio como duas metades da mesma estratégia: um modelo poderoso que pensa, emparelhado com uma interface que permite conversar com ele como um colega.

Fique à frente da IA

Para cobertura contínua de lançamentos de modelos, IA de voz e tudo o que molda a indústria, acompanhe os mais recentes desenvolvimentos de IA em AI Buzz Wire.

Leia mais notícias sobre IA →