A Inception Labs lançou o Mercury 2.5 na terça-feira, uma nova versão de seu modelo de linguagem de difusão comercial que a empresa descreve como o LLM de difusão mais capaz do mercado e, até onde se sabe, o maior modelo de linguagem de difusão já treinado. De acordo com o anúncio da empresa, o modelo oferece um aumento de 40% em inteligência em relação ao seu antecessor, Mercury 2, ao mesmo tempo que mantém o mesmo perfil de serviço de baixa latência e baixo custo que tornou a arquitetura de difusão atraente para cargas de trabalho de alto volume.

A empresa, liderada pelo CEO Stefano Ermon, afirma que o Mercury 2.5 é comparável aos modelos fronteiriços com custo otimizado, incluindo GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite e Claude Haiku 4.5. Estas comparações são comunicadas pelos fornecedores e ainda não foram verificadas por benchmarks independentes, mas posicionam um modelo de difusão – há muito uma curiosidade de investigação – como uma alternativa de produção aos operadores históricos auto-regressivos. Para obter as últimas notícias sobre modelos de IA, siga a cobertura contínua do modelo da AI Buzz Wire. últimas notícias sobre modelos de IA

Velocidade, Contexto e Preço

Os números das manchetes são agressivos. O Inception Labs afirma que o Mercury 2.5 gera 1.107 tokens por segundo em GPUs NVIDIA amplamente disponíveis, com uma janela de contexto de 260.000 tokens. O preço é definido em US$ 0,20 por milhão de tokens de entrada e US$ 0,75 por milhão de tokens de saída, com uma promoção de lançamento descontando o modelo de 80% para US$ 0,04 por milhão de entrada e US$ 0,15 por milhão de saída.

No lado da capacidade, o modelo vem com raciocínio ajustável – permitindo que os desenvolvedores negociem latência por profundidade por solicitação – junto com chamadas de ferramentas paralelas e saída JSON alinhada ao esquema para geração estruturada. A empresa enquadra o lançamento como o primeiro resultado de um ciclo de treinamento impulsionado pela telemetria de produção: desde o lançamento do Mercury 2, milhares de desenvolvedores construíram com ele, dezenas de empresas o implantaram e o uso cresceu mais de uma ordem de magnitude.

Por que os modelos de difusão geram texto mais rápido

Os LLMs convencionais da OpenAI, Google e Anthropic são autorregressivos: eles geram texto, um token por vez, com cada token condicionado a tudo o que foi gerado antes dele. Essa dependência sequencial coloca um piso duro na velocidade de geração. Em vez disso, os modelos de linguagem de difusão começam com um bloco de ruído e refinam iterativamente todos os tokens em paralelo, o que permite um rendimento muito maior em hardware de GPU convencional, uma vez que o modelo é treinado para convergir de forma limpa.

A compensação tem sido historicamente a qualidade: os modelos de difusão têm seguido os autoregressivos em termos de referência de raciocínio e seguimento de instruções. A principal aposta da Inception Labs – e a afirmação subjacente ao Mercury 2.5 – é que esta lacuna diminuiu até ao ponto em que a difusão ganha no eixo que a maioria dos clientes realmente sente: latência e custo no volume de produção.

Reivindicações de produção dos primeiros clientes

O anúncio depende fortemente das implantações dos clientes, e não das tabelas de benchmark. OpenCall, que cria agentes telefônicos de IA para chamadas ao vivo de clientes, relatou que a mudança para Mercury elevou a latência média de resposta do modelo para cerca de 170 milissegundos. Oliver Silverstein, cofundador e CEO da OpenCall, disse que o tempo de resposta do P99 da empresa caiu de vários minutos para um segundo, e sua mediana de 0,4 segundos para menos de 0,2 – números que ele descreveu como significativamente mais rápidos do que qualquer outro provedor que a empresa testou, inclusive com raciocínio habilitado.

Augment Code, um fabricante de assistente de codificação de IA, usa Mercury para compactação de contexto, roteamento de modelo e pesquisa de ferramentas MCP. De acordo com o Inception Labs, mover cargas de trabalho de compactação para Mercury reduziu a latência dessa etapa em 82%, de aproximadamente 150 segundos para 27 segundos, e reduziu seu custo em 90%, mantendo a qualidade. O caso de uso ilustra onde a economia afeta: os agentes de codificação fazem muitas pequenas chamadas de modelo de suporte em cada geração primária, e a latência e o custo aumentam nessas chamadas.

A NVIDIA, cujo hardware executa o modelo, também opinou. Shruti Koparkar, gerente sênior de produto do Accelerated Computing Group da NVIDIA, disse que a Inception possui modelos avançados de linguagem baseados em difusão na infraestrutura de IA da NVIDIA, e que o avanço da qualidade do Mercury 2.5 com velocidades sustentadas mostra quão rapidamente novas arquiteturas podem amadurecer em sistemas prontos para produção.

Pré-visualizações do Mercury Voice e do Mercury Router

Juntamente com o modelo, a Inception Labs anunciou prévias de dois novos produtos. Mercury Voice é um LLM de difusão otimizado para agentes de voz com os orçamentos de latência mais restritos, anunciando o tempo até o primeiro token abaixo de 170 milissegundos. O Mercury Router usa um modelo de difusão para entender os prompts recebidos e encaminhá-los para qualquer modelo – aberto ou fechado – que ofereça a melhor combinação de qualidade, velocidade e custo, posicionando a Inception como uma camada acima de seus concorrentes, bem como um deles.

O Mercury 2.5 está disponível através da própria API do Inception, bem como através do Baseten e OpenRouter. As implantações empresariais adicionam capacidade dedicada, escalonamento automático, controles de conformidade e retenção de dados configurável. A empresa está oferecendo 100 milhões de tokens gratuitos para desenvolvedores que testam a API.

A empresa também disse que já começou a treinar seu próximo modelo – o maior até agora, com lançamento previsto para os próximos meses – que descreve como um salto em capacidade que não abre mão da velocidade de difusão ou da eficiência simbólica. Se esta afirmação se mantiver, a pressão sobre os operadores históricos autoregressivos será sentida primeiro nos níveis de mercadorias do mercado, onde o preço e a latência decidem a maioria dos contratos.

Fique à frente da IA

Acompanhe os últimos desenvolvimentos de IA e as últimas notícias sobre inteligência artificial à medida que novos modelos de arquiteturas entram em produção.

Leia mais notícias sobre IA →