Децентралізована лабораторія штучного інтелекту Prime Intellect опублікувала результати широкомасштабного експерименту, який перевіряє, наскільки добре сучасні передові моделі штучного інтелекту можуть виконувати дослідження автономного машинного навчання — і найкращі з них надзвичайно наблизилися до рівня людського світового рекорду за відомим тестом спільноти.
Проект, який отримав назву NanoGPT Speedrun Frontier і був опублікований 22 серпня, складався з 153 автономних прогонів через 18 граничних моделей, які намагалися виконати швидкісний запуск оптимізатора nanoGPT — змагання, в якому дослідники шукали найефективніший спосіб навчити невелику мовну модель для фіксованої цілі якості. Історія швидко потрапила на першу сторінку Hacker News, де вона викликала десятки коментарів, які обговорювали, що результати говорять про здатність ШІ робити справжні наукові відкриття. For more context on this story, see our ongoing more AI stories.
Що таке NanoGPT Speedrun насправді
Тест отримано зі сховища modded-nanogpt, яке підтримує Келлер Джордан, і довгий список учасників спільноти. Сформулювати завдання оманливо просто: використовуючи 8 графічних процесорів NVIDIA H100, якнайшвидше навчіть мовну модель, яка досягає 3,28 крос-ентропійних втрат у наборі перевірки FineWeb — рівня продуктивності, досягнутого оригінальною реплікацією GPT-2 Андрея Карпаті через 45 хвилин.
Завдяки сотням внесків спільноти за останні два роки людський рекорд знизився до 75 секунд і 400 мільйонів тренувальних жетонів, що є більш ніж у 30 разів покращенням у порівнянні з оригінальним рецептом. Рішення-переможці читаються як каталог сучасної техніки машинного навчання: оптимізатор Muon, обертові вбудовування з QK-Norm, активації ReLU-squared, квантування FP8 за увагою та пропусками MLP, Flash Attention 3 із шаблонами ковзного вікна та десятки інших методів, накладених одна на одну.
У тесті Prime Intellect використовувався трек оптимізатора еталонного тесту, який — відповідно до документації репозиторію — мінімізує кількість кроків навчання, необхідних для досягнення цільової втрати, за умови фіксованої архітектури, набору даних і розміру пакету з фактично необмеженим бюджетом настінного годинника. Це робить його чистим тестом виявлення алгоритму, а не простою апаратною швидкістю.
Як працював експеримент
Кожна з 18 моделей отримала автономне завдання: запропонувати зміни до рецепту навчання, запустити експерименти, перевірити результати та повторити — із фіксованим сценарієм перевірки та фіксованими випадковими початковими числами, які гарантують, що заявлене покращення є реальним, а не випадковим. Як резюмував один коментатор Hacker News, моделей попросили дослідити, як покращити навчання маленької моделі, неодноразово пробуючи зміни, тестуючи їх і використовуючи результати, щоб вирішити, що робити далі.
Моделі працювали за допомогою різноманітних пакетів агентів — у тому числі claude-code, codex OpenAI, kimi-code, grok-cli, qwen-code та власного основного агента Prime Intellect — і команда відстежувала споживання токенів кожного запуску, кількість експериментів, виклики інструментів і час, що минув агенту. Загалом під час експерименту було використано сотні мільйонів токенів на топову модель і мільярди по всій мережі.
Таблиця лідерів: Fable 5 очолює групу
Головний результат: модель, визначена як Fable 5, що проходить через систему claude-code, закрила 81,7 відсотка розриву між базовим рецептом і людським записом, з найкращим перевіреним результатом 2726 за показником таблиці лідерів. На це знадобилося 8,7 днів сукупного часу агента, приблизно 800 мільйонів токенів, 811 експериментів і близько 3000 викликів інструментів.
Групу переслідувачів очолював Opus 5, який скоротив 53,6 відсотка розриву, а за ним йшов Kimi K3 з 52,2 відсотка за допомогою основного агента Prime Intellect (і 45,8 відсотка за допомогою kimi-code). Opus 4.8 досяг 39,4 відсотка, кілька варіантів GPT-5.6 досягли приблизно від 11 до 36 відсотків, Sonnet 5 закрився 26,8 відсотка, а Grok 4.5 і Qwen3.8 Max досягли приблизно 24,6 відсотка.
Далі нижче DeepSeek V4 Pro скоротив 12,3 відсотка розриву, GPT-5.5 досяг 8,1 відсотка, а старший Kimi K2.7 фінішував на 7,2 відсотка. Примітно, що одна нещодавно випущена модель — GLM 5.3 — ще працювала під час публікації без перевірених записів, нагадуючи, що тест карає моделі, які не можуть надійно перевірити власні вдосконалення.
Чому це важливо
Подібні тести мають значення, тому що вони вимірюють те, чого таблиці лідерів кодування не можуть: здатність запускати справжній дослідницький цикл — гіпотезу, експеримент, аналіз, перегляд — протягом днів, а не хвилин. Ця здатність є основою нової галузі автономних досліджень штучного інтелекту, у якій агентам доручено не писати код у специфікації, а відкривати речі, які їм ніхто не показував.
Розкид результатів сам по собі є інформативним. Згідно з описом проекту, майже кожна модель в експерименті виявила ті самі ключові виграшні ідеї — що відокремило найкращі прогони, так це те, що залишив експеримент: сильніші агенти зберігали слабкі сигнали в шумних результатах достатньо довго, щоб перевірити їх, і краще розуміли власні експериментальні дані.
Застереження від спільноти
Коментатори Hacker News підняли справедливі методологічні моменти. Параметри зусиль і джгути відрізнялися для різних моделей — Fable 5 працював на високому рівні міркування, тоді як Opus 5 працював на максимумі — і арифметика 153 прогонів у 18 моделях означає, що деякі моделі отримували більше спроб, ніж інші. Питання, чи відображає рейтинг моделі її необроблені дослідницькі здібності чи якість її використання, залишається відкритим.
Та все ж напрямок руху зрозумілий. Коли найшвидшим людським рукам знадобилися роки колективних зусиль, щоб досягти поточного рекорду, найкращі автономні агенти тепер закривають більшу частину цього розриву трохи більше ніж за тиждень обчислювального часу. На наступне запитання — чи може будь-яка модель закрити решту 18,3 відсотка — можна відповісти раніше, ніж очікувалося.
Щоб дізнатися більше про контрольні показники та дослідження, які формують передові межі штучного інтелекту, слідкуйте за новинами AI Buzz Wire.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →