Відповідно до результатів, опублікованих у середу ARC Prize Foundation, GPT-6 Astra від OpenAI опублікувала найсучасніші результати в ARC-AGI-3, тесті абстрактного мислення, розробленому для вимірювання агентського інтелекту. Модель набрала 62,7 % у тесті Semi-Private (Напівприватне) за стандартною схемою базової системи та 99,9 % при оцінці за допомогою джгута адаптера постачальника, який зберігає внутрішній стан міркування моделі між запитами.
Результати були отримані через день після того, як OpenAI розпочала поетапне впровадження Astra, флагманської моделі, яку компанія назвала початком нової ери. Для читачів, які намагаються стежити за показниками передових лабораторій, сторінка [останніх розробок штучного інтелекту] (https://aibuzzwire.news) відстежує кожну важливу версію.
Два джгути, два дуже різні бали
Розрив між двома заголовками Astra є найважливішою деталлю у звіті. ARC Prize оцінює агентів у різних системах, і кожен змінює те, що моделі дозволено робити у своєму власному контексті.
За допомогою стандартної системи під час роботи в середовищі модель може передавати нотатки, які вона вирішила зберегти. З такою настройкою Astra при максимальних зусиллях міркування набрала 62,7% результатів із загальною вартістю 26 098 доларів США для оцінювання. На протилежному кінці, запуск того самого джгута з вимкненим обґрунтуванням дав лише 35,2% і в той же час коштував більше — 49 791 долар — тому що моделі потрібно було набагато більше дій, щоб прогресувати.
Адаптер провайдера є щедрішим: він зберігає непрозорий стан міркування моделі між запитами та використовує згортання для тривалих розмов, дозволяючи Astra повторно використовувати попередню роботу. За цією системою Astra набрала 99,9% за високу ефективність аргументації за 18 817 доларів США та 98,6% за максимальну ефективність за 17 332 долари США. Навіть найнижча міркування досягла 96,7%.
Іншими словами, різниця між частковим показником і майже ідеальним полягає не лише в сирих можливостях — це те, скільки робочого стану моделі зберігається між кроками.
Побиття людей за ефективністю дій
ARC-AGI-3 побудовано навколо нових, абстрактних, покрокових ігрових середовищ. Агенти повинні досліджувати без вказівок, робити висновки про те, як працює світ, визначати цілі за рідкими винагородами та планувати багатоетапні дії. Середовища відкалібровані таким чином, що люди можуть розв’язати їх на 100%, що робить продуктивність людини базовою для порівняння.
Astra не просто вирішила більшість рівнів — вона вирішила їх ефективно. Відповідно до премії ARC Prize, модель використовувала менше дій, ніж середня протестована людина на 96% рівнів, перевершуючи базовий рівень ефективності дій людини у всьому наборі.
Економіка порівняння є суворою. Учасникам тестування на людях платили 115 доларів за 90-хвилинну сесію плюс 5 доларів за завершену гру, тобто приблизно 12,78 доларів за спробу гри. Повна оцінка Astra коштує п’ять цифр залежно від конфігурації. Але премія ARC відзначила протиінтуїтивну зморшку: більші зусилля на міркування зазвичай коштують дешевше, оскільки Astra вирішувала ігри за меншу кількість дій, зменшуючи загальну кількість викликів моделі та жетонів, спалених за один запуск.
Модель, яка створює власну мову
Крім балів, премія ARC підкреслила якісну поведінку, яку спостерігала команда. Astra послідовно перетворювала незнайоме середовище на компактні символічні моделі світу — представляючи ігрову механіку як логічні правила, і розробляючи власний доменно-спеціальний стенограм для відстеження стану та планування дій.
Саме для дослідження цієї навички був розроблений ARC-AGI-3. У той час як попередні покоління тесту перевіряли гнучкі міркування над новими шаблонами, третє покоління перевіряє, чи може агент досліджувати, моделювати, встановлювати цілі та виконувати плани в середовищах, яких він ніколи не бачив — такі компоненти, як ARC Prize, включають дослідження, моделювання, встановлення цілей, а також планування та виконання.
Тло ери AGI
Результати порівняльного тесту були отримані на тлі максимальної риторики самого OpenAI. На брифінгу для преси перед запуском у четвер президент компанії Грег Брокман сказав, що «нерозумно відчувати, що ми зараз перебуваємо в епосі AGI», але не зробив офіційної заяви, згідно з висвітленням запуску The New Stack. Він описав AGI як «концепцію місії або духовну концепцію», а не як договірний механізм.
Дослідник OpenAI Ейдан Кларк сказав, що Astra була найбільшим навчальним запуском компанії на сьогоднішній день — першим попереднім навчанням на понад 100 000 графічних процесорів на майданчику Зоряних воріт у Техасі — і першим випуском OpenAI, у якому більш ранні моделі відігравали значну роль у нагляді за процесом навчання. Доступ залишається поетапним: розгортання починається з корпоративних клієнтів у програмі Daybreak, доступність Plus, Pro, Business і Enterprise, а також доступ до API та AWS обіцяють найближчими днями.
Зірочка на рахунку
Обережність виправдана з кількох сторін. Ефективність ARC-AGI-3 Astra сильно залежить від конфігурації джгута, як показують дві цифри в заголовку, і користувацькі джгути, які зберігають стан моделі, були постійною точкою суперечок у суперечках щодо тестування. Аналіз запуску, проведений New Stack, зазначив, що Astra «відзначає великі переваги в спеціалізованих завданнях, але вона важлива і не лідирує в пакеті кодування» — це нагадування про те, що контрольні тести агентних головоломок і повсякденні комерційні навантаження вимірюють різні речі.
Сама ARC Prize визначає вправу як вимірювання «залишкового розриву» між поточним ШІ та AGI, визначаючи AGI як здатність здобувати будь-які навички, які може отримати людина, так само ефективно, як і людина. Майже ідеальна оцінка за сприятливих умов сама по собі не ліквідує цей розрив. І при ціні від 17 000 до 50 000 доларів США за оцінку лише добре забезпечені лабораторії можуть дозволити собі провести тест у такому масштабі, хоча дані про вартість ARC Prize показують, що розумніші міркування можуть фактично зменшити рахунок.
Чому це важливо
Ефективність дій - це справді нова вісь порівняння. Модель, яка вирішує кожен рівень, але витрачає на це тисячі дзвінків, є менш корисною — і дорожчою — ніж та, яка діє, як це зробила тут Astra: свідомо досліджує, стискає те, що дізнається, і діє відповідно до цього. Який би висновок не робили про дебати AGI, дані Премії ARC показують, що прикордонні агенти тепер порівнюють людей не лише за тим, чи можуть вони вирішити нові проблеми, а й за тим, наскільки економічно вони їх вирішують.
Будьте попереду ШІ
Кожен результат порівняльного тесту, запуск моделі та обговорення безпеки, що відстежуються по ходу — читайте більше новин AI →
