Децентрализованная лаборатория искусственного интеллекта Prime Intellect опубликовала результаты крупномасштабного эксперимента, проверяющего, насколько хорошо современные модели искусственного интеллекта могут выполнять автономные исследования машинного обучения — и лучшие из них оказались удивительно близки к мировому рекорду человечества в знаменитом тесте сообщества.
Проект, получивший название NanoGPT Speedrun Frontier и опубликованный 22 августа, состоял из 153 автономных прогонов 18 пограничных моделей с попытками ускорить запуск оптимизатора nanoGPT — соревнования, в котором исследователи ищут наиболее эффективный способ обучения небольшой языковой модели фиксированному целевому качеству. Эта история быстро попала на первую полосу Hacker News, где вызвала десятки комментариев, обсуждающих, что результаты говорят о способности ИИ к подлинным научным открытиям. Подробнее об этой истории — в нашем последние разработки в ИИ.
Что на самом деле представляет собой спидран NanoGPT
Тест взят из репозитория modded-nanogpt, поддерживаемого Келлером Джорданом и длинным списком участников сообщества. Задача обманчиво проста: с помощью 8 графических процессоров NVIDIA H100 обучить языковую модель, которая достигнет кросс-энтропийной потери 3,28 на наборе проверки FineWeb — уровня производительности, которого первоначальная репликация GPT-2 Андрея Карпати достигла через 45 минут — как можно быстрее.
Благодаря сотням вкладов сообщества за последние два года человеческий рекорд сократился до менее 75 секунд и менее 400 миллионов тренировочных токенов, что более чем в 30 раз лучше исходного рецепта. Победившие решения читаются как каталог современного машинного обучения: оптимизатор Muon, ротационные встраивания с QK-Norm, квадратичные активации ReLU, квантование FP8 по вниманию и проходы MLP, Flash Attention 3 с шаблонами скользящего окна и десятки других методов, наложенных друг на друга.
В тесте Prime Intellect использовался трек оптимизатора эталонного теста, который, согласно документации репозитория, сводит к минимуму количество шагов обучения, необходимых для достижения целевых потерь, при условии фиксированной архитектуры, набора данных и размера пакета, с фактически неограниченным бюджетом настенных часов. Это делает его чистым тестом на открытие алгоритма, а не на чистую скорость оборудования.
Как работал эксперимент
Каждой из 18 моделей была поставлена задача автономно: предлагать изменения в рецепте обучения, проводить эксперименты, проверять результаты и выполнять итерации — с фиксированным сценарием проверки и фиксированными случайными начальными числами, гарантирующими, что заявленное улучшение является реальным, а не случайным. Как резюмировал один из комментаторов Hacker News, моделям было предложено изучить, как улучшить обучение небольшой модели, неоднократно пробуя изменения, тестируя их и используя результаты, чтобы решить, что попробовать дальше.
Модели работали с использованием различных агентских средств, включая claude-code, кодекс OpenAI, kimi-code, grok-cli, qwen-code и собственный прайм-агент Prime Intellect, а команда отслеживала потребление токенов при каждом запуске, количество экспериментов, вызовы инструментов и затраченное время агента. В общей сложности эксперимент израсходовал сотни миллионов токенов на топ-модель и миллиарды по всей сети.
Таблица лидеров: Fable 5 лидирует
Главный результат: модель, обозначенная как Fable 5, прошедшая через систему клод-кода, закрыла 81,7 процента разрыва между базовым рецептом и человеческими данными, с лучшим подтвержденным результатом 2726 по метрике таблицы лидеров. Для этого потребовалось 8,7 дней совокупного времени агентов, примерно 800 миллионов токенов, 811 экспериментов и около 3000 вызовов инструментов.
В группе преследователей лидировал Opus 5, который сократил разрыв на 53,6 процента, за ним следовал Kimi K3 с 52,2 процента при использовании системы основного агента Prime Intellect (и 45,8 процента при помощи кода Kimi). Opus 4.8 набрал 39,4 процента, несколько вариантов GPT-5.6 получили примерно от 11 до 36 процентов, Sonnet 5 закрыл 26,8 процента, а Grok 4.5 и Qwen3.8 Max каждый достигли примерно 24,6 процента.
Далее DeepSeek V4 Pro закрыл отставание на 12,3 процента, GPT-5.5 достиг 8,1 процента, а более старый Kimi K2.7 финишировал с отставанием в 7,2 процента. Примечательно, что одна недавно выпущенная модель — GLM 5.3 — на момент публикации все еще работала без подтвержденной записи, что является напоминанием о том, что тест наказывает модели, которые не могут надежно подтвердить свои собственные улучшения.
Почему это важно
Бенчмарки имеют такое значение, потому что они измеряют то, что не могут измерить таблицы лидеров кодирования: возможность запустить настоящий цикл исследования — выдвижение гипотезы, эксперимент, анализ, пересмотр — в течение нескольких дней, а не минут. Эта способность лежит в основе развивающейся области исследований автономного ИИ, в которой перед агентами стоит задача не писать код по заданию, а обнаруживать вещи, которые им никто не показывал.
Разброс результатов сам по себе информативен. Согласно описанию проекта, почти каждая модель в эксперименте обнаружила одни и те же основные выигрышные идеи — лучшие прогоны отличались тем, что оставляет после себя эксперимент: более сильные агенты сохраняли слабые сигналы в зашумленных результатах достаточно долго, чтобы их проверить, и лучше понимали свои собственные экспериментальные данные.
Предостережения сообщества
Комментаторы Hacker News подняли справедливые методологические вопросы. Настройки усилия и ремни безопасности варьировались в зависимости от модели — Fable 5 работала на высоком уровне рассуждения, а Opus 5 — на максимальном — и арифметика 153 запусков на 18 моделях означает, что некоторые модели получили больше попыток, чем другие. Вопрос о том, отражает ли рейтинг модели ее исследовательские способности или качество ее использования, остается открытым.
Тем не менее, направление движения ясно. Если самым быстрым человеческим рукам потребовались годы коллективных усилий, чтобы достичь текущего рекорда, то лучшие автономные агенты теперь преодолевают большую часть этого разрыва за чуть более недели вычислительного времени. На следующий вопрос — сможет ли какая-либо модель закрыть оставшиеся 18,3 процента — можно ответить раньше, чем ожидалось.
Чтобы узнать больше о тестах и исследованиях, формирующих передовые технологии искусственного интеллекта, следите за постоянными репортажами AI Buzz Wire.
---
Будьте в курсе ИИПоследние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.
Читать больше новостей об ИИ →