Cerebras Systems e OpenAI compartilharam uma visão inicial do Modo Ultrafast, um novo nível de serviço lançado primeiro na API OpenAI e alimentado pela tecnologia em escala de wafer Cerebras. A parceria permite que o GPT-5.6 Sol funcione a até 750 tokens de saída por segundo, fornecendo inteligência de ponta em velocidades em tempo real. Para obter as últimas notícias sobre hardware de IA, visite AI Buzz Wire.
Eliminando a compensação entre velocidade e inteligência
Os criadores de IA enfrentam há muito tempo uma compensação fundamental: à medida que os modelos aumentam em tamanho e inteligência, incorrem em custos computacionais e de movimentação de dados mais elevados, diminuindo os tempos de resposta. Os desenvolvedores foram forçados a escolher entre esperar por resultados de alta qualidade ou aceitar resultados inferiores em menos tempo.
GPT-5.6 Sol no modo Ultrafast foi projetado para resolver esse dilema. De acordo com a Cerebras, o serviço roda 11 vezes mais rápido que o Claude Fable da Anthropic, 5 e 5 vezes mais rápido que o Opus 4.8 no modo Rápido, com base nas velocidades de saída relatadas pela Análise Artificial.
Último exame da humanidade: o teste de velocidade
A Cerebras colocou o Ultrafast à prova contra modelos concorrentes no Último Exame da Humanidade (HLE), um benchmark desafiador que consiste em 2.500 questões normalmente respondidas apenas por aqueles com doutorado em áreas como química, economia e literatura.
Nas avaliações realizadas pela Cerebras, o GPT-5.6 Sol em Modo Ultrarrápido respondeu todas as 2.500 questões do HLE em 11 horas e 11 minutos. Claude Fable 5 precisou de 78 horas e 27 minutos, mais de três dias de computação contínua, para chegar às mesmas conclusões. Em outras palavras, a Ultrafast processou a fronteira do conhecimento humano em um único dia de trabalho, alcançando uma precisão comparável quase sete vezes mais rápida.
O benchmarking foi realizado pela Cerebras usando GPT-5.6 Sol Ultrafast com Codex em configurações de alto raciocínio em 10 de julho, e Claude Fable 5 com Claude Code em configurações de alto raciocínio de 13 a 15 de julho.
Impacto nos negócios no mundo real
No GDP-Val, uma referência para tarefas de trabalho de conhecimento economicamente valiosas, o Ultrafast proporcionou uma aceleração de ponta a ponta de 5,6x sem degradação da qualidade. Isso demonstra como uma inferência mais rápida pode acelerar trabalhos economicamente valiosos sem sacrificar a qualidade da produção.
A Cerebras vê o Ultrafast como uma ferramenta para cenários onde cada segundo é importante. As empresas que operam serviços web poderiam usar a tecnologia para identificar as causas e resolver as interrupções de produção mais rapidamente, preservando a confiança do cliente e evitando a perda de receitas. Em situações de segurança cibernética de alto risco, as equipes de segurança podem aproveitar o Ultrafast para detectar e responder rapidamente a ataques.
A tecnologia por trás da velocidade
A vantagem de desempenho decorre da arquitetura Wafer-Scale Engine da Cerebras, que foi desenvolvida especificamente para cargas de trabalho de IA de ponta. O principal desafio da inferência rápida de fronteira é um problema de movimentação de dados: em GPUs tradicionais, a inferência em modelos grandes é prejudicada pela largura de banda da memória, pois os pesos dos modelos devem ser transferidos repetidamente entre a memória no chip e o armazenamento fora do chip para gerar tokens sucessivos.
A Cerebras adota uma abordagem fundamentalmente diferente. Cada chip do tamanho de um wafer contém 44 GB de SRAM diretamente no silício. Os pesos do modelo permanecem no chip e os tokens fluem ininterruptamente através das camadas do modelo canalizadas através dos wafers. Isso elimina a movimentação de dados ineficiente que retarda a inferência baseada em GPU e se adapta suavemente ao tamanho do modelo, abrindo caminho para uma vantagem contínua de velocidade em futuros modelos de fronteira.
Disponibilidade e posicionamento de mercado
GPT-5.6 Sol no modo ultrarrápido está atualmente disponível em uma versão prévia limitada para um grupo seleto de clientes, com acesso expandido ao longo do tempo à medida que a capacidade aumenta. A Cerebras descreve a parceria como impulsionando a próxima onda de inovação em IA e elevando o limite para o que as organizações podem realizar com IA responsiva.
A colaboração representa um marco significativo para a Cerebras, que há muito busca a computação em escala wafer como uma alternativa ao mercado de hardware de IA dominado por GPU. Ao fazer parceria direta com a OpenAI para acelerar um dos modelos de fronteira mais capazes disponíveis, a Cerebras está defendendo fortemente que sua arquitetura oferece uma vantagem competitiva genuína para cargas de trabalho de inferência de alta velocidade.
À medida que os modelos continuam a crescer e a ser mais inteligentes, a capacidade de os servir a velocidades em tempo real poderá tornar-se um factor competitivo definidor no mercado de infra-estruturas de IA. A parceria Cerebras-OpenAI sinaliza que a corrida pela velocidade de inferência é agora tão importante quanto a corrida pela inteligência do modelo.
Fique à frente da IA
Para mais notícias sobre hardware de IA, análise de desempenho de modelos e desenvolvimentos do setor, marque AI Buzz Wire.
Leia mais notícias sobre IA →