Zgodnie z wynikami opublikowanymi w środę przez fundację ARC Prize Foundation, komputer GPT-6 Astra należący do OpenAI opublikował najnowocześniejsze wyniki w ARC-AGI-3, benchmarku abstrakcyjnego rozumowania zaprojektowanym do pomiaru inteligencji agentycznej. Model uzyskał 62,7% w teście porównawczym w zestawie półprywatnym w ramach standardowej uprzęży fundacji i 99,9% w ocenie z uprzężą Provider Adapter, która zachowuje wewnętrzny stan rozumowania modelu pomiędzy żądaniami.
Wyniki pojawiły się dzień po rozpoczęciu przez OpenAI etapowego wdrażania Astry, flagowego modelu, który firma określiła jako początek nowej ery. Dla czytelników, którzy chcą śledzić wyniki testów porównawczych Frontier Labs, strona najnowsze osiągnięcia AI śledzi na bieżąco każdą większą wersję.
Dwie uprzęże, dwa bardzo różne wyniki
Najważniejszym szczegółem raportu jest różnica między dwoma głównymi liczbami Astry. Nagroda ARC ocenia agentów w różnych zastosowaniach, a każdy z nich zmienia to, co model może zrobić w swoim własnym kontekście.
W ramach standardowej uprzęży model może przenosić notatki, które zdecyduje się zachować podczas pracy w środowisku. Przy takim ustawieniu Astra przy maksymalnym wysiłku rozumowania uzyskała 62,7%, a całkowity koszt testu wyniósł 26 098 USD. Z drugiej strony, uruchomienie tej samej uprzęży z wyłączonym rozumowaniem dało zaledwie 35,2%, a kosztowało więcej – 49 791 dolarów – ponieważ model wymagał znacznie większej liczby działań, aby osiągnąć postęp.
Wiązka Adaptera dostawcy jest bardziej hojna: zachowuje nieprzejrzysty stan rozumowania modelu pomiędzy żądaniami i wykorzystuje zagęszczanie w przypadku dłuższych rozmów, umożliwiając Astrze ponowne wykorzystanie wcześniejszej pracy. W tej uprzęży Astra uzyskała 99,9% przy dużym wysiłku rozumowania za 18 817 USD i 98,6% przy maksymalnym wysiłku za 17 332 USD. Nawet najniższe ustawienie rozumowania osiągnęło poziom 96,7%.
Innymi słowy, różnica między wynikiem częściowym a niemal idealnym nie polega wyłącznie na surowych możliwościach — chodzi o to, jaka część stanu roboczego modelu przetrwa pomiędzy etapami.
Pokonywanie ludzi pod względem efektywności działania
ARC-AGI-3 opiera się na nowatorskich, abstrakcyjnych środowiskach gier turowych. Agenci muszą eksplorować bez instrukcji, wnioskować, jak działa świat, identyfikować cele na podstawie skąpych nagród i planować wieloetapowe działania. Środowiska są skalibrowane w taki sposób, aby ludzie mogli je rozwiązać w 100%, co sprawia, że wydajność człowieka jest punktem odniesienia, względem którego mierzy się wyniki.
Astra nie tylko rozwiązała większość poziomów — rozwiązała je skutecznie. Według nagrody ARC w modelu zastosowano mniej działań niż mediana testowanego człowieka na 96% poziomów, przekraczając wyjściową skuteczność działania człowieka w całym zestawie.
Ekonomia porównania jest wyraźna. Uczestnicy testu na ludziach otrzymywali 115 dolarów za 90-minutową sesję plus 5 dolarów za ukończoną grę, co dawało mniej więcej 12,78 dolara za każdą próbę gry. Pełny przebieg próbny Astry kosztuje pięć cyfr, w zależności od konfiguracji. Jednak nagroda ARC zauważyła sprzeczną z intuicją wadę: większy wysiłek w zakresie rozumowania zazwyczaj kosztuje mniej, ponieważ Astra rozwiązywała gry w mniejszej liczbie akcji, zmniejszając całkowitą liczbę wywołań modeli i spalonych tokenów na przebieg.
Model, który buduje swój własny język
Oprócz wyników nagroda ARC podkreśliła zaobserwowane przez zespół zachowanie jakościowe. Astra konsekwentnie przekształcała nieznane środowiska w zwarte, symboliczne modele świata — przedstawiając mechanikę gry jako reguły logiczne i opracowując własny, specyficzny dla danej dziedziny skrót, umożliwiający śledzenie stanu i planowanie działań.
To jest właśnie umiejętność, którą ARC-AGI-3 miał badać. Podczas gdy wcześniejsze generacje testu porównawczego testowały płynne rozumowanie w oparciu o nowe wzorce, trzecia generacja sprawdza, czy agent potrafi eksplorować, modelować, wyznaczać cele i wykonywać plany w środowiskach, których nigdy nie widział – elementy wymienione przez ARC Prize obejmują eksplorację, modelowanie, wyznaczanie celów oraz planowanie i realizację.
Tło ery AGI
Wyniki testów porównawczych uzyskano w atmosferze maksymalnej retoryki samego OpenAI. Na konferencji prasowej poprzedzającej czwartkową premierę prezes firmy Greg Brockman powiedział, że „nie jest nierozsądne uczucie, że żyjemy teraz w erze AGI”, powstrzymując się jednak od formalnej deklaracji, jak wynika z relacji z premiery opublikowanej przez The New Stack. Opisał AGI raczej jako „koncepcję misji lub koncepcję duchową”, a nie wyzwalacz umowny.
Badacz OpenAI, Aidan Clark, powiedział, że Astra była jak dotąd największym szkoleniem firmy – pierwszym, które zostało wstępnie przeszkolone na ponad 100 000 procesorów graficznych w ośrodku Stargate w Teksasie – i pierwszą wersją OpenAI, w której wcześniejsze modele odegrały znaczącą rolę w nadzorowaniu procesu szkolenia. Dostęp pozostaje etapowy: wdrażanie rozpoczyna się od klientów korporacyjnych w programie Daybreak, a w nadchodzących dniach obiecane są dostępność Plus, Pro, Business i Enterprise oraz dostęp do interfejsów API i AWS.
Gwiazdka na partyturze
Ostrożność jest uzasadniona na kilku frontach. Wydajność ARC-AGI-3 Astry zależy w dużej mierze od konfiguracji uprzęży, jak pokazują dwa nagłówki, a niestandardowe uprzęże, które zachowują stan modelu, były powracającym punktem spornym w sporach dotyczących benchmarków. Analiza premiery przeprowadzona przez New Stack wykazała, że Astra „odnotowuje duże zyski w przypadku wyspecjalizowanych zadań, ale jest to płatne i nie przewodzi wyraźnie pakietowi kodowania” – co przypomina, że testy porównawcze łamigłówek agentycznych i codzienne obciążenia komercyjne mierzą różne rzeczy.
Nagroda ARC sama w sobie określa to ćwiczenie jako pomiar „resztkowej luki” pomiędzy obecną sztuczną inteligencją a AGI, definiując AGI jako zdolność do zdobycia wszelkich umiejętności, jakie potrafi człowiek, tak efektywnie, jak to tylko możliwe. Wynik niemal idealny w sprzyjających warunkach sam w sobie nie zamyka tej luki. Przy cenie od 17 000 do 50 000 dolarów za cykl ewaluacyjny tylko laboratoria posiadające odpowiednie zasoby mogą sobie pozwolić na przeprowadzenie testu porównawczego na taką skalę — choć dane dotyczące kosztów nagrody ARC pokazują, że mądrzejsze rozumowanie może w rzeczywistości obniżyć rachunek.
Dlaczego to ma znaczenie
Skuteczność działania to naprawdę nowa oś porównań. Model, który rozwiązuje każdy poziom, ale marnuje na to tysiące połączeń, jest mniej przydatny – i droższy – niż ten, który działa tak, jak zrobiła to tutaj Astra: celowe eksplorowanie, kompresowanie zdobytej wiedzy i działanie na jej podstawie. Niezależnie od wniosków z debaty na temat AGI, dane przyznane przez ARC Prize pokazują, że agenci z pogranicza dopasowują się obecnie do ludzi nie tylko pod względem tego, czy potrafią rozwiązać nowe problemy, ale także pod względem tego, jak ekonomicznie je rozwiązują.
Wyprzedź sztuczną inteligencję
Śledzone na bieżąco wszystkie wyniki testów porównawczych, wprowadzenie modelu na rynek i debata na temat bezpieczeństwa — przeczytaj więcej aktualności o sztucznej inteligencji →
