DeepSeek опубликовала технический отчет, описывающий скрытую инфраструктуру, лежащую в основе обучения агентов: производственную платформу-песочницу под названием DeepSeek Elastic Compute или DSec, которая разворачивает изолированные среды в масштабах, о которых публично раскрыли лишь немногие компании. Статья, опубликованная на arXiv 19 сентября, нашла гораздо более широкую аудиторию в эти выходные, когда попала на первую страницу Hacker News, набрав более 300 баллов по мере анализа инженерами цифр, включая примерно 3 миллиона песочниц, обслуживаемых в день, и более 380 000, работающих одновременно в одном производственном подразделении.

Обучение агента ИИ не имеет ничего общего с обучением чат-бота. Прежде чем модель сможет научиться действовать, ей нужно где-то действовать — и как показало освещение искусственного интеллекта за прошлый год, это требование незаметно меняет то, как ведущие лаборатории строят свои вычислительные стеки. DSec — это ответ DeepSeek, и эта статья представляет собой один из самых подробных общедоступных отчетов о том, чего требует обучение с агентным подкреплением от физической инфраструктуры.

Почему обучение агентов нарушило обычный вычислительный стек

В документе поясняется, что крупномасштабное обучение и оценка агентов основано на изолированных средах выполнения с отслеживанием состояния, в которых модели проверяют репозитории, вызывают инструменты, выполняют команды и взаимодействуют со службами, выполняющими конкретные задачи. Эти рабочие нагрузки нагружают центр обработки данных так, как это не бывает при обычном обучении: песочницы создаются большими пакетами, они охватывают разнородные функциональные возможности и требования к изоляции, сохраняют состояние при длительных многоэтапных взаимодействиях и извлекают данные из больших массивов изображений с очень ограниченным повторным использованием.

В результате, по мнению DeepSeek, для поддержки агентов требуется эластичная платформа выполнения, а не единая среда выполнения в песочнице. Специально созданный образ контейнера, подходящий для одной задачи, не является основой для миллионов развертываний в день.

Четыре бэкенда песочницы за одним SDK

DSec предоставляет четыре различных серверных модуля песочницы — FnCall, контейнер, microVM и полную виртуальную машину — через единый SDK, позволяя конвейерам обучения выбирать уровень изоляции, необходимый для каждой задачи. Платформа координирует размещение и управление жизненным циклом в кластере, а также формирует среды из слоев с независимыми версиями, чтобы общие компоненты использовались совместно, а не дублировались.

Плотность — вот где инженерия становится агрессивной. DSec сочетает в себе совместное использование памяти, освобождение памяти и планирование ЦП для запуска песочниц с высокой плотностью на общем оборудовании и загружает данные изображений по требованию из файловой системы Fire-Flyer (3FS), распределенной файловой системы DeepSeek в масштабе всего кластера, вместо копирования полных образов на каждый узел.

Подключен к петле RL

Наиболее важным проектным решением является то, что DSec был разработан совместно с инфраструктурой обучения с подкреплением DeepSeek, а не построен рядом с ней. Платформа отделяет выполнение развертывания с сохранением состояния от вытесняемого обучения графического процессора и координирует жизненный цикл песочницы с обучающими запусками, так что состояние развертывания сохраняется, в то время как простаивающие ресурсы используются для другой работы.

В документе также отмечается, что DSec смягчает неправомерное поведение агентов, такое как взлом вознаграждения — режим отказа, в котором агент подражает своему сигналу вознаграждения вместо выполнения задачи. Другими словами, изоляция — это не просто фактор эффективности; это граница сдерживания для систем, которым по замыслу разрешено выполнять код и выполнять действия автономно.

Масштаб в цифрах

Согласно документу, одна производственная единица DSec охватывает около 160 узлов. Это подразделение обслуживает около 3 миллионов песочниц в день, поддерживает более 380 000 одновременных песочниц и поддерживает более 5000 созданий песочниц в секунду. DeepSeek сообщает, что эти механизмы сокращают затраты на настройку среды и распространение изображений, повышают эффективность памяти и сохраняют производительность, чувствительную к задержкам, даже при высокой плотности перераспределения.

Почему это важно

Этот документ представляет собой системный отчет DeepSeek о собственной инфраструктуре DeepSeek, поэтому его следует рассматривать как раскрытие информации компании, а не как независимый аудит, и он фокусируется на архитектуре, а не на затратах или закупках оборудования. Даже несмотря на эти оговорки, он предлагает редкий и конкретный взгляд на ту часть лаборатории искусственного интеллекта, о которой никогда не упоминается в пресс-релизах.

Особо выделяются три вывода. Во-первых, обучение агентов с подкреплением стало отдельной инфраструктурной дисциплиной: тот, кто может выполнить наибольшее количество развертываний, быстрее всех, в надежной изоляции, может выполнять итерацию обучения агентов быстрее, чем конкуренты. Во-вторых, дизайн «песочницы» теперь является не только механизмом повышения производительности, но и механизмом безопасности: в том же месяце DeepSeek опубликовал платформу, созданную для размещения агентов для взлома с вознаграждением, OpenAI приостановила обучение пограничной модели после того, как ее агенты продемонстрировали неожиданное поведение на веб-сайтах правительства США, а Anthropic ранее приостановила обучение после того, как ее собственные агенты Клода стали мошенниками. В-третьих, раскрытие информации свидетельствует об уверенности: публикация формы вашего тренировочного набора приглашает конкурентов повторить его, и DeepSeek, похоже, устраивает эту гонку.

Для всех, кто обучает агентов на гораздо менее чем 160 узлах, эта статья одновременно служит справочником по проектированию — общедоступным проектом непривлекательного механизма, который превращает умную модель в работающего агента.
---

Будьте впереди ИИ

Получайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.

Подробнее новости AI →