Китайская лаборатория искусственного интеллекта Z.ai опубликовала подробный технический отчет о том, как она заставляет модели GLM работать над улучшением самих систем, которые их обслуживают, описывая «Инфра-агент», который находит и устраняет узкие места в производительности в инфраструктуре вывода компании с ограниченным вмешательством человека.

Сообщение в блоге под названием «На пути к рекурсивному самосовершенствованию: как GLM построила собственную инфраструктуру вывода» появилось на сайте компании в среду и быстро стало одной из самых обсуждаемых технологических историй на Hacker News, где она получила более 200 баллов от сообщества разработчиков. Подробнее об этой истории — в нашем тенденции ИИ.

«По мере того, как мы разрабатываем GLM, модель иногда демонстрирует возможности, которые нас удивляют и даже тревожат», — написала компания в первых строках сообщения.

От исследований в области кибербезопасности к самооптимизирующимся системам

Работа началась в октябре 2025 года, когда Z.ai начал исследовать способы усиления возможностей GLM по кибербезопасности. Аргументация, по словам компании, была простой: кибербезопасность является естественным продолжением кодирования, а модели, которые могут перемещаться по большим базам кода, в конечном итоге могут перемещаться по низкоуровневому системному коду, которого избегает большинство инженеров.

Этот фонд превратился в нечто более амбициозное. Вместо того, чтобы использовать модели просто для написания кода, Z.ai решил ответить на вопрос системной инженерии: может ли ИИ-агент взять на себя ответственность за производительность производственного стека вывода, уровня координации программного и аппаратного обеспечения, который превращает веса модели в быстрые и дешевые ответы?

Ответ компании заключался в переосмыслении проблемы. В статье утверждается, что одни только сквозные метрики не могут служить руководством для оптимизирующего агента. Отчет о том, что время появления первого токена увеличилось на 30 процентов или что пропускная способность вывода упала на 20 процентов, говорит агенту, что что-то стало хуже, но не говорит о том, какой уровень за это отвечает, почему его гипотеза не удалась или что тестировать дальше.

«Как нам превратить редкие сквозные результаты в детальную, понятную обратную связь с инженерами, которая напрямую определяет последующие действия?» — спрашивает компания в своем сообщении, описывая этот вопрос как ключевой во всех усилиях.

Три правила для обратной связи, читаемой агентом

Ответ Z.ai — это дисциплина обратной связи, основанная на трех характеристиках. Во-первых, обратная связь должна быть достаточно локальной, привязанной к конкретным параметрам запуска движка, изменениям кода, ядрам, условиям ввода, потокам, интервалам выполнения или путям кода, чтобы агент мог сузить масштаб любой проблемы. Во-вторых, оно должно быть недорогим и своевременным: вопрос, на который можно ответить с помощью теста ядра или локального микробенчмарка, не должен требовать развертывания полного сервиса. В-третьих, проверка должна соответствовать текущей гипотезе, при этом каждый эксперимент должен отвечать на конкретный вопрос, а не следовать фиксированной последовательности.

Компания заявляет, что именно этот плотный цикл обратной связи позволяет Infra Agent вести себя не как автозаполнение для инженеров, а скорее как коллега, который может проводить эксперименты в одночасье.

Три примера: от числовых вычислений до ошибки многопоточности

В статье рассматриваются три конкретных эпизода оптимизации стека обслуживания компании для GLM-5.3-Flash, открытой модели Z.ai, выпущенной по лицензии MIT в августе.

Первое предполагает правильность. Поскольку оптимизация вывода меняет способ распараллеливания вычислений, агенту необходимо было убедиться, что ядра дают одинаковые результаты в условиях секционирования и несекционирования. В одном случае команда объединила три операции TF32 Tensor Core для получения более точного результата, уменьшив накопленную числовую ошибку, сохранив при этом большую часть преимущества в производительности Tensor Core. Сравнительное тестирование стратегий разделения выявило несоответствия, которые послужили причиной исправления.

Вторая — это история отладки систем, которая будет знакома любому инженеру по производительности. Критерии приемки требовали, чтобы добавление передачи кэша KV в путь обслуживания не снижало производительность предварительного заполнения более чем на 5 процентов при идентичных рабочих нагрузках. Агент обнаружил, что в некоторых сценариях разрыв превышает 20 процентов, что сузило расследование до параллельного поведения самой передачи KV. Изучая сроки выполнения, агент выявил аномалию: в проблемных сценариях выполнение передачи KV на стороне Python никогда не пересекалось с интервалами отправки и объединения коммуникационной библиотеки DeepEP. Исправление заключалось в снятии глобальной блокировки интерпретатора Python во время соответствующих интервалов выполнения C++, что позволяло потоку передачи, обслуживающему Mooncake, хранилищу кэша KV, работать параллельно с вычислениями. Впоследствии разрыв в производительности оказался в пределах приемлемого порога.

В третьем эпизоде ​​показана итеративная настройка ядра. Внедрение ReplaySSM, технологии, которая обменивает вычисления на память, изначально увеличило время выполнения ядра декодирования KDA. Оптимизация разделения агента затем сократила время выполнения ядра на 9,6 процента. Получив обратную связь о том, что вычисления остаются основным узким местом, агент обнаружил исходную реализацию, расположенную вдоль измерения V, что привело к ненужному повторению идентичных вычислений нормализации FP32 и стробирования.

Стек GLM-5.3-Flash

Оптимизации основаны на агрессивной архитектуре обслуживания, которую Z.ai описывает в посте: внутриузловой тензорный параллелизм для линейного внимания и головы языковой модели, обмен вычислениями для памяти ReplaySSM, квантование W8A8, квантование кэша смешанной точности с использованием форматов INT8, FP8 и BF16, схема разделения слоев и дезагрегированная архитектура кодирования-предварительного заполнения-декодирования, которая запускает этапы обслуживания на отдельных ресурсах.

Компания рассматривает накопление этих методов, открытых и проверенных в основном самим агентом, как шаг к рекурсивному самосовершенствованию: системы искусственного интеллекта улучшают инфраструктуру, что делает их работу быстрее и дешевле, что, в свою очередь, делает следующий раунд усовершенствований, управляемых агентами, более доступным.

Почему это важно

Стоимость вывода — один из решающих экономических показателей индустрии искусственного интеллекта. Лаборатории, которые могут обслуживать модели передового класса по более низкой цене за токен, могут устанавливать агрессивные цены, субсидировать агентов, которые делают тысячи вызовов для каждой задачи, и финансировать дальнейшее обучение за счет дохода от обслуживания. Z.ai вела себя особенно агрессивно на всех трёх фронтах, и промежуточные финансовые раскрытия компании в начале этого года показали, что выручка резко выросла, даже несмотря на то, что убытки сократились.

Этот пост также является сигналом о том, в каком направлении движется лабораторная инженерия. Традиционное разделение труда, когда инженеры по производительности настраивают ядра и планировщики, пока модели обрабатывают запросы пользователей, в Z.ai заменяется циклом, в котором модель предлагает изменения, дешевые эксперименты подтверждают их, а плотная обратная связь определяет следующую попытку.

К заявлениям о полностью автономном самосовершенствовании следует относиться с осторожностью. В самом посте ясно говорится, что инженеры-люди определили сценарии тестирования, установили критерии приемки и создали среду обратной связи, в которой работает агент. То, что описывает компания, — это автоматизация хорошо оснащенного цикла оптимизации, а не неконтролируемое перепроектирование системы.

Несмотря на это, направление ясно. Если экономика искусственного интеллекта в ближайшие несколько лет будет определяться тем, кто сможет дешевле обслуживать разведку, то темп могут задавать лаборатории, обучающие их моделям для оптимизации собственной инфраструктуры, и Z.ai хочет, чтобы отрасль знала, что она намерена быть одной из них.

---

Будьте в курсе ИИ

Последние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.

Читать больше новостей об ИИ →