A Cerebras e a OpenAI deram ao mundo uma visão antecipada do Modo Ultrarápido, um novo nível de serviço que é lançado primeiro na API OpenAI e é desenvolvido com hardware da Cerebras. De acordo com o anúncio da Cerebras publicado em 13 de agosto de 2026, o GPT-5.6 Sol rodando em Ultrafast oferece até 750 tokens de saída por segundo — sem comprometer a qualidade.

O nível está inicialmente disponível para um grupo seleto de clientes, com acesso expandido ao longo do tempo. O anúncio, escrito por Joyce Er da Cerebras, posiciona a oferta como uma solução para um compromisso que definiu o desenvolvimento de produtos de IA durante anos: os construtores tiveram que escolher entre velocidade e inteligência, porque modelos maiores e mais inteligentes incorrem em custos computacionais e de movimentação de dados mais elevados que retardam os tempos de resposta. Os leitores que acompanham a corrida para acelerar os modelos de fronteira podem acompanhar os desenvolvimentos mais recentes no AI Buzz Wire.

Quão rápido é o ultrarrápido, exatamente?

O número bruto de rendimento é impressionante por si só, mas a Cerebras também forneceu um contexto comparativo. De acordo com as velocidades de saída relatadas pela Artificial Analysis, um serviço de benchmarking independente, GPT-5.6 Sol no modo Ultrafast executa:

  • 11x mais rápido que Fable 5
  • 5x mais rápido que o Opus 4.8 no modo Rápido

Para testar a afirmação, a Cerebras executou o modelo frente a frente com concorrentes populares no Último Exame da Humanidade (HLE), um benchmark desafiador que consiste em 2.500 perguntas que normalmente são respondidas apenas por pessoas com doutorado em áreas como química, economia e literatura.

O resultado: GPT-5.6 Sol em Ultrafast respondeu todas as 2.500 perguntas HLE em 11 horas e 11 minutos. Claude Fable 5 precisou de 78 horas e 27 minutos — mais de três dias de computação contínua — para chegar às mesmas conclusões. Em outras palavras, o Ultrafast ultrapassou a fronteira do conhecimento humano em um único dia de trabalho, alcançando uma precisão comparável quase 7 vezes mais rápida.

A Cerebras destacou sua metodologia de benchmarking: GPT-5.6 Sol Ultrafast foi testado com Codex em raciocínio xhigh em 10 de julho, enquanto Claude Fable 5 foi testado com Claude Code em raciocínio xhigh de 13 a 15 de julho.

Cargas de trabalho do mundo real, não apenas benchmarks

Os benchmarks de velocidade podem ser enganosos se a qualidade diminuir ao longo do caminho, e é por isso que a Cerebras também destacou os resultados no GDP-Val, um benchmark para tarefas de trabalho de conhecimento economicamente valiosas. No PIB-Val, o Ultrafast entregou uma aceleração de ponta a ponta de 5,6x sem degradação de qualidade, de acordo com testes que a Cerebras realizou em 31 de julho de 2026 usando GPT-5.6 Sol e GPT-5.6 Sol Ultrafast em raciocínio médio dentro do Codex.

A empresa afirma que o GPT-5.6 Sol é o melhor modelo da OpenAI para resumos jurídicos, modelos financeiros e relatórios de engenharia – domínios onde a qualidade da produção e o tempo de resposta têm consequências financeiras diretas.

Por que a velocidade muda a equação do agente

A mudança mais importante pode estar na forma como os agentes de IA operam. A inferência mais rápida muda o que é possível para indivíduos e organizações, porque os agentes podem ser colocados no caminho crítico dos problemas onde cada segundo conta.

“Com o GPT-5.6 Sol Ultrafast, a Cerebras permite IA que acompanha a forma como você pensa, codifica e colabora”, disse Rohan Varma, Produto da OpenAI, em comunicado citado no anúncio. "Estamos entusiasmados em ver como os fluxos de trabalho e os aplicativos são transformados pela inferência Ultrafast."

A Cerebras descreveu vários cenários de alto risco onde a aceleração é importante:

Resposta a incidentes

As empresas que operam serviços web podem usar o Ultrafast para identificar a causa raiz e solucionar interrupções de produção, preservando a confiança do cliente, evitando perda de receita e economizando minutos de inatividade em relação aos seus SLAs.

Cibersegurança

Em ataques cibernéticos adversários e de alto risco, as equipes de segurança devem detectar e responder rapidamente aos malfeitores para conter perdas catastróficas — uma tarefa em que a latência de inferência afeta diretamente o controle de danos.

Produtividade do agente

O Ultrafast permite novos modos de trabalhar com agentes, fornecendo insights e atualizações em tempo real, reduzindo a necessidade de mudança de contexto em sessões paralelas.

“Embora antes eu pudesse ter que esperar alguns minutos para que uma tarefa terminasse, agora ela termina antes mesmo de eu ter a oportunidade de mudar de contexto. Isso me torna muito mais produtivo”, disse Jeffrey Wang, pesquisador da OpenAI, no anúncio.

A estratégia por trás da parceria

Para a Cerebras, o acordo representa outro marco em seu esforço para comercializar a aceleração em escala de wafer para inferência de IA. Para OpenAI, o Modo Ultrafast adiciona um nível de velocidade premium à sua API em um momento em que a latência de inferência se tornou um diferencial competitivo – especialmente para aplicativos de agente que encadeiam muitas chamadas de modelo, onde os atrasos por chamada se somam a minutos de espera.

As empresas enquadram a camada como uma vantagem persistente para organizações que usam IA de ponta para responder rapidamente às informações recebidas, combinando o processamento ultrarrápido para trabalhos urgentes com o processamento padrão para tarefas básicas que podem ser paralelizadas em segundo plano.

O acesso está sendo implementado gradualmente. Os desenvolvedores interessados ​​​​podem monitorar a disponibilidade da documentação da API OpenAI, já que a Cerebras diz que o acesso se expandirá ao longo do tempo a partir do grupo inicial seleto de clientes.

Fique à frente da IA

Para obter mais cobertura sobre a corrida de hardware e infraestrutura que remodela a inteligência artificial, marque AI Buzz Wire e siga nosso feed de notícias de hardware de IA.

Leia mais notícias sobre IA →