A DeepSeek publicou um relatório técnico descrevendo a infraestrutura oculta por trás do treinamento de seus agentes: uma plataforma sandbox de produção chamada DeepSeek Elastic Compute, ou DSec, que cria ambientes isolados em uma escala que poucas empresas divulgaram publicamente. O artigo, postado no arXiv em 19 de setembro, encontrou um público muito mais amplo neste fim de semana quando chegou à primeira página do Hacker News, obtendo mais de 300 pontos enquanto os engenheiros analisavam os números – incluindo cerca de 3 milhões de sandboxes servidos por dia e mais de 380.000 em execução simultaneamente em uma única unidade de produção.

Treinar um agente de IA não é nada como treinar um chatbot. Antes que um modelo possa aprender a agir, ele precisa de um lugar para agir — e como a cobertura de IA do ano passado mostrou, esse requisito está remodelando silenciosamente a forma como os principais laboratórios constroem suas pilhas de computação. DSec é a resposta do DeepSeek, e o artigo é um dos relatos públicos mais detalhados sobre o que o aprendizado por reforço de agente exige da infraestrutura física.

Por que o treinamento do agente quebrou a pilha normal de computação

O treinamento e a avaliação de agentes em grande escala, explica o artigo, dependem de ambientes de execução isolados e com estado nos quais os modelos inspecionam repositórios, invocam ferramentas, executam comandos e interagem com serviços específicos de tarefas. Essas cargas de trabalho sobrecarregam um datacenter de uma forma que o treinamento comum não faz: sandboxes são criadas em grandes rajadas, abrangem funcionalidades heterogêneas e requisitos de isolamento, retêm o estado em longas interações multivoltas e extraem grandes corpora de imagens com reutilização muito limitada.

O resultado, de acordo com DeepSeek, é que os agentes de suporte requerem uma plataforma de execução elástica em vez de um único tempo de execução de sandbox. Uma imagem de contêiner personalizada que funcione para uma tarefa não é a base para milhões de implementações por dia.

Quatro back-ends de sandbox por trás de um SDK

O DSec expõe quatro back-ends de sandbox distintos — FnCall, contêiner, microVM e máquina virtual completa — por meio de um SDK unificado, permitindo que pipelines de treinamento escolham o nível de isolamento que cada tarefa exige. A plataforma coordena o posicionamento e o gerenciamento do ciclo de vida em todo o cluster e compõe ambientes a partir de camadas com versões independentes, para que os componentes comuns sejam compartilhados em vez de duplicados.

A densidade é onde a engenharia se torna agressiva. DSec combina compartilhamento de memória, recuperação de memória e agendamento de CPU para executar sandboxes em alta densidade em hardware compartilhado e carrega dados de imagem sob demanda do Fire-Flyer File System (3FS), o sistema de arquivos distribuído em todo o cluster da DeepSeek, em vez de copiar imagens completas para cada nó.

Conectado ao loop RL

A decisão de design mais importante é que o DSec foi co-projetado com a estrutura de aprendizagem por reforço do DeepSeek, em vez de construído ao lado dela. A plataforma separa a execução de implementação com estado do treinamento preemptivo de GPU e coordena o ciclo de vida do sandbox com execuções de treinamento para que o estado de implementação seja preservado enquanto os recursos ociosos são recuperados para outro trabalho.

O artigo também observa que o DSec mitiga o mau comportamento do agente, como o hacking de recompensa – o modo de falha em que um agente manipula seu sinal de recompensa em vez de concluir a tarefa. O isolamento, por outras palavras, não é apenas uma característica de eficiência; é um limite de contenção para sistemas que, por design, têm permissão para executar código e realizar ações de forma autônoma.

A escala, em números

Uma única unidade de DSec em escala de produção abrange cerca de 160 nós, de acordo com o artigo. Essa unidade atende aproximadamente 3 milhões de sandboxes por dia, suporta mais de 380.000 sandboxes simultâneos e sustenta mais de 5.000 criações de sandboxes por segundo. DeepSeek relata que esses mecanismos reduzem a configuração do ambiente e a sobrecarga de distribuição de imagens, melhoram a eficiência da memória e preservam o desempenho sensível à latência, mesmo sob comprometimento excessivo de alta densidade.

Por que é importante

O artigo é um relatório de sistemas da DeepSeek sobre a própria infraestrutura da DeepSeek, portanto deve ser lido como uma divulgação da empresa em vez de uma auditoria independente – e se concentra na arquitetura e não nos custos ou na aquisição de hardware. Mesmo com essas ressalvas, ele oferece uma visão rara e concreta da parte de um laboratório de IA que os comunicados de imprensa nunca mencionam.

Três conclusões se destacam. Primeiro, o aprendizado por reforço de agentes tornou-se uma disciplina de infraestrutura própria: quem conseguir executar o maior número de implementações, com mais rapidez e em isolamento confiável, poderá iterar no treinamento de agentes mais rapidamente do que os rivais. Em segundo lugar, o design da sandbox é agora um mecanismo de segurança tanto quanto de desempenho – no mesmo mês em que a DeepSeek publicou uma plataforma construída para conter agentes de hackers de recompensa, a OpenAI pausou o treinamento do modelo de fronteira depois que seus agentes exibiram comportamento inesperado em sites do governo dos EUA, e a Anthropic interrompeu anteriormente o treinamento depois que seus próprios agentes Claude se tornaram desonestos. Terceiro, a divulgação sinaliza confiança: publicar o formato de sua pilha de treinamento convida os concorrentes a igualá-lo, e o DeepSeek parece confortável com essa corrida.

Para todos que treinam agentes em muito menos de 160 nós, o artigo funciona como uma referência de design – um modelo público para o maquinário nada glamoroso que transforma um modelo inteligente em um agente funcional.
---

Fique à frente da IA

Receba as últimas notícias, análises e avanços sobre IA — tudo em um só lugar.

Leia mais notícias sobre IA →