OpenAI está trazendo recursos de agente baseados em voz para o aplicativo móvel ChatGPT, permitindo que os usuários acionem o trabalho real – redigir documentos, resumir e-mails, construir apresentações – simplesmente falando, anunciou a empresa na quarta-feira, conforme relatado pelo TechCrunch.
A implementação se estende aos recursos de smartphones que a OpenAI oferecia anteriormente em desktops e chega à medida que a voz se torna uma das formas de crescimento mais rápido que os usuários interagem com assistentes de IA para tarefas complexas.
O que os assinantes podem fazer por voz
Os assinantes Plus e Pro poderão usar a guia Trabalho no aplicativo móvel ChatGPT para criar documentos, redigir e-mails ou resumir mensagens do Slack por voz. O mesmo fluxo de trabalho de voz cobre tarefas mais pesadas que a guia Trabalho já suporta, como construção de sites, criação de apresentações, uso do navegador na nuvem e pesquisa na área financeira do ChatGPT.
Os usuários do Free and Go obtêm uma fatia menor da atualização, ganhando a capacidade de trabalhar com plug-ins e aplicativos conectados.
A OpenAI disse que as conversas por voz agora produzirão uma saída de texto mais rica e os usuários podem mover-se com fluidez entre os modos de voz e texto. Talvez a adição mais prática para pessoas que fazem malabarismos com deslocamentos e desktops: uma conversa iniciada em trânsito pode ser retomada mais tarde no aplicativo de desktop.
O caminho do GPT-Live para os agentes móveis
A atualização é o capítulo móvel de uma história que a OpenAI começou em julho, quando lançou o GPT-Live, seu novo modelo de conversação, e mais tarde conectou-o ao aplicativo de desktop para que os usuários pudessem concluir tarefas da guia Trabalho e criar aplicativos na guia Codex por voz. O anúncio de quarta-feira fecha o ciclo, trazendo a mesma execução de tarefas orientada por voz para os telefones.
Por que os agentes de voz em dispositivos móveis são importantes
A mudança reflete como os padrões de uso estão mudando. Mais usuários estão recorrendo à voz para emitir comandos aos assistentes de IA para tarefas complexas, e o telefone é onde esses comandos acontecem com mais naturalidade – entre reuniões, no carro ou longe de um teclado.
Até agora, os recursos de agente mais poderosos do ChatGPT residiam no desktop. Os usuários que desejavam que o ChatGPT construísse uma apresentação ou executasse uma tarefa de pesquisa em várias etapas precisavam estar em seus computadores, digitando instruções na guia Trabalho. O aplicativo móvel, apesar de toda a sua popularidade, era em grande parte uma superfície de conversação. A atualização de quarta-feira acaba com essa distinção: o telefone se torna um lugar legítimo para iniciar um trabalho substantivo, com o canal de voz como interface.
A divisão da assinatura
O lançamento também aprimora os limites entre os níveis de assinatura do ChatGPT. Assinantes Plus e Pro – os planos que já possuem os limites de uso mais altos e acesso aos modelos mais capazes do OpenAI – obtêm a experiência completa da guia Trabalho orientada por voz, incluindo criação de documentos, redação de e-mail e resumo do Slack. Eles também podem construir sites, criar apresentações, usar o navegador na nuvem e acessar a área financeira do ChatGPT, tudo por voz.
Os usuários do Free and Go recebem um conjunto mais limitado de recursos centrados em plug-ins e aplicativos conectados. Essa classificação segue um padrão familiar para OpenAI: provar uma capacidade no desktop e, em seguida, trazer uma versão móvel cujos recursos mais valiosos levam os usuários a planos pagos. Para a OpenAI, a mudança aprofunda o fosso em torno de seus níveis pagos, num momento em que os rivais estão cortejando agressivamente os mesmos usuários.
Como se compara à abordagem da Anthropic
O cenário competitivo é importante aqui. O TechCrunch observa que a Anthropic recentemente facilitou a transferência entre dispositivos móveis e desktops para seus próprios usuários e fundiu suas interfaces de Cowork e Chat em uma única experiência. A OpenAI, por outro lado, ainda mantém o bate-papo e os espaços de trabalho separados – uma divisão deliberada do produto que mantém as conversas casuais distintas do espaço de trabalho onde ficam os arquivos, projetos e ferramentas.
As duas empresas estão efetivamente realizando experimentos opostos no design de fluxo de trabalho do assistente de IA. A interface mesclada da Anthropic aposta que os usuários desejam uma única superfície unificada que os acompanhe em todos os dispositivos. A aposta da OpenAI é que o chat e os espaços de trabalho estruturados atendam a necessidades diferentes e permaneçam distintos, com a voz atuando como tecido conjuntivo – inicie uma tarefa falando no celular, refine-a com um teclado no desktop.
O que assistir a seguir
A próxima pergunta óbvia é a distância que os agentes de voz percorrem a partir da guia Trabalho. A integração de desktop da OpenAI já chega ao Codex, sua ferramenta de criação de aplicativos, e a paridade móvel transformaria os telefones em superfícies de desenvolvimento completas. OpenAI não anunciou o momento para isso.
Também não resolvido é a confiabilidade. As tarefas de voz agentes – rascunho, resumo, navegação – envolvem execução em várias etapas, onde os erros se acumulam e os ambientes móveis adicionam interrupção e mudança de contexto. A experiência inicial do usuário determinará se o trabalho orientado por voz se tornará um hábito diário ou permanecerá um recurso amigável para demonstração.
De qualquer forma, a direção da viagem é clara: espera-se que o assistente que respondeu às perguntas por voz há dois anos termine a tarefa antes de você chegar à sua mesa. Com a atualização de quarta-feira, os usuários móveis do OpenAI podem iniciar essa tarefa com uma frase – e lembrá-la em uma tela maior quando chegarem.
---
Fique à frente da IAReceba as últimas notícias, análises e avanços sobre IA — tudo em um só lugar.
Leia mais notícias sobre IA →