O Google lançou o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking, um par de modelos de diálogo ao vivo que a empresa descreve como os mais avançados até agora para conversas por voz natural. Os modelos começaram a ser implementados em 15 de setembro na API Gemini, Google AI Studio, Search Live, Gemini Live e Google Workspace, com acesso empresarial em visualização privada por meio do Gemini Enterprise.
O anúncio veio de Tom Ouyang, engenheiro principal, e Malini Jaganathan, membro da equipe técnica, escrevendo em nome da equipe Gemini Audio. Ele amplia a família Gemini 3.8 que estreou no início deste mês com os modelos Flash e Flash Cyber, e marca o impulso mais agressivo do Google até agora na assistência de voz multimodal em tempo real – um mercado onde o modo de voz da OpenAI e uma onda de startups de fala estão competindo pelo mesmo caso de uso diário.
O lançamento se enquadra em um período extremamente concorrido da linha de modelos do Google; a cobertura dos últimos desenvolvimentos de IA mostra que a empresa já lançou repetidamente no espaço de algumas semanas, enquanto luta contra rivais em preços, codificação e agora voz.
Criado para conversas em tempo real
O que distingue os modelos Live de um modelo de chat padrão com microfone conectado é a latência e o estado. A documentação da Live API do Google descreve uma interface de baixa latência que processa fluxos contínuos de áudio, imagens e texto em uma conexão WebSocket com estado, aceitando áudio PCM bruto de 16kHz, imagens JPEG em até um quadro por segundo e texto, e retornando áudio falado em tempo real.
Os modelos processam a entrada visual quase em tempo real, permitindo que o assistente veja o que o usuário vê – os vídeos de demonstração do Google mostram o Gemini 3.8 Live orientando uma sessão de integração de funcionários usando contexto visual, jogando xadrez quase em tempo real e construindo planos de negócios completos e kits de ferramentas de marketing personalizados por meio da fala natural. Os modelos também podem detectar e fazer a transição entre 97 idiomas suportados automaticamente, no meio da conversa, sem que o usuário altere as configurações.
Talvez o mais significativo para uso prático: os modelos executam ferramentas e chamadas de API em segundo plano enquanto a conversa continua, reconhecendo as solicitações e mantendo o diálogo enquanto as tarefas terminam. Isso transforma o assistente de um entrevistado estritamente baseado em turnos em algo mais próximo de um agente que fala.
Os números que o Google está divulgando
O Google relata que o Gemini 3.8 Live Extended Thinking conquistou a primeira posição geral no Índice de Qualidade de Fala em Fala da Análise Artificial com uma pontuação de 82,6. Na conclusão da tarefa de agente, a empresa cita 68,6% no benchmark τ-Voice e 35,1% na avaliação τ-Voice-banking da Sierra, juntamente com uma pontuação de 97,7% no Big Bench Audio.
Esses são os números relatados pelo próprio Google, e a verificação independente levará tempo – mas a reivindicação ao topo do gráfico da Análise Artificial, se for mantida, colocaria o Google à frente das ofertas otimizadas para fala da OpenAI e de empresas dedicadas de IA de voz na qualidade geral da conversa. O Google também afirma que o Extended Thinking mantém um preço altamente competitivo, um aceno implícito à pressão de preços que definiu a geração 3.8.
Todo o áudio gerado pelos modelos tem marca d’água SynthID, a marca d’água imperceptível do Google, de modo que a fala gerada por IA permanece detectável – uma proteção de conformidade e desinformação que está se tornando padrão em todos os produtos generativos do Google.
Onde você pode usá-lo
A disponibilidade difere entre os dois modelos. O Gemini 3.8 Live está disponível para todos no Search Live, o modo de pesquisa visual em tempo real do Google. O Extended Thinking está disponível no Gemini Live, no Docs para assinantes do Google AI Pro e Ultra por meio do Workspace e no Gmail e Keep para todos os usuários do Google.
Os desenvolvedores obtêm os modelos por meio da API Gemini e do Google AI Studio, e o Google afirma que a API Live já é usada por plataformas como Agora, Fishjam, LiveKit, Pipecat, Vercel e Vision Agents para construir interfaces orientadas por voz sobre a infraestrutura em tempo real do Google. Salesforce, Genspark e Lumeris são nomeados parceiros de lançamento dos novos modelos.
Um mercado lotado de IA de voz
A voz está se tornando o campo de batalha da interface em 2026 porque é onde a IA finalmente escapa do teclado. Um modelo que pode ver, ouvir, mudar de idioma e executar ferramentas enquanto fala está competindo não com outros chatbots, mas com a chamada telefônica, a linha de atendimento ao cliente e o assistente pessoal.
A vantagem do Google é a distribuição: Search, Android, Workspace e Chrome dão aos modelos Live uma base instalada que nenhum rival pode igualar. A empresa aposta que estar presente em todos os momentos do dia do usuário – agora com seus melhores modelos de voz – será mais importante do que qualquer vitória em um benchmark. Os rivais terão a chance de responder, mas o Google deixou claro que a voz, que já foi um recurso de demonstração, agora é uma linha de produtos de primeira classe.
Para os desenvolvedores, a mensagem é igualmente direta. Ao publicar formatos de entrada exatos, documentar a execução de ferramentas em segundo plano e semear o ecossistema com plataformas Live API, o Google está tentando tornar sua pilha o substrato padrão para qualquer pessoa que crie interfaces faladas – desde bots de suporte ao cliente até assistentes vestíveis. Quer as reivindicações de qualidade do Gemini 3.8 Live se mantenham em testes independentes, o jogo de disponibilidade já está em movimento.
---
Fique à frente da IAReceba as últimas notícias, análises e avanços sobre IA — tudo em um só lugar.
Leia mais notícias sobre IA →