Według niezależnej firmy zajmującej się benchmarkingiem Artificial Analysis, OpenAI wypuściło GPT-6.1 Sol 29 września, wycofując GPT-6 Sol zaledwie siedem dni po debiucie tego modelu. Zamiana zbiegła się w czasie z firmową konferencją programistów DevDay, podczas której CNET poinformował, że uczestnicy mogą natychmiast rozpocząć korzystanie z GPT-6.1 Sol wraz z nowo wprowadzonymi agentami Dots i zestawem zmian w subskrypcji.
Siedmiodniowa wymiana statku flagowego na flagowy jest nietypowa nawet jak na przyspieszone standardy z 2026 r., a testy porównawcze sugerują, dlaczego OpenAI rozwijało się szybko. Aby stale relacjonować premiery modeli, walki o benchmarki i związaną z nimi wojnę cenową, AI Buzz Wire śledzi istotne zmiany na bieżąco.
Wymierny skok w siedem dni
Sztuczna analiza podaje, że GPT-6.1 Sol zyskuje 4 punkty w firmowym indeksie inteligencji w stosunku do GPT-6 Sol i 5 punktów w stosunku do GPT-5.6 Sol, plasując się zaledwie 1 punkt poniżej GPT-6 Astra, najpotężniejszego modelu OpenAI. Ocena firmy łączy rozumowanie, pracę z wiedzą, matematykę i zadania agentyczne w jeden wynik porównawczy.
Wyniki cząstkowe pokazują, gdzie koncentrują się zyski. GPT-6.1 Sol poprawił się o 4 punkty w AA-Briefcase v1.1 i 5 punktów w PKBval-AA v2.1, w obu przypadkach testowana jest wiedza agenta. Skok o 12 punktów w Terminal-Bench 4.0 wskazuje na znacznie lepszą wydajność w rzeczywistych środowiskach terminali, podczas gdy Humanity's Last Exam wzrósł o 5 punktów, a plik PKB.pdf wzrósł o 6.
Jedna liczba wyróżnia każdego, kto wykorzystuje modele do badań: dokładność AA-Omniscience wzrosła o 8 punktów, podczas gdy wskaźnik halucynacji spadł z 60 procent do 54 procent. Obie liczby pozostają wysokie w wartościach bezwzględnych, ale kierunek przemieszczania się ma znaczenie w przepływach pracy, w których pewna błędna odpowiedź jest gorsza niż brak odpowiedzi.
Ta sama cena naklejki, w praktyce tańsza
Jeśli chodzi o ceny, GPT-6.1 Sol utrzymuje stawkę GPT-6 Sol wynoszącą 2 USD za milion tokenów wejściowych i 10 USD za milion tokenów wyjściowych, ale rabat za odczyt pamięci podręcznej wzrasta z 90% do 95%. Sztuczna analiza zauważa, że mieszana cena GPT-6.1 Sol dla obciążeń agentowych jest zatem nieco niższa niż GPT-6 Sol, przedłużając passę skutecznych obniżek cen, która rozpoczęła się wraz z wprowadzeniem GPT-6 Sol z 50% rabatem w stosunku do GPT-5.6 Sol.
Trajektoria cen jest tutaj prawdziwą historią. W ciągu dwóch wydań OpenAI dwukrotnie obniżyło efektywne koszty swojej średniej klasy rozwiązań, za każdym razem podnosząc jakość.
Koszt zadania: 0,72 USD w porównaniu z 3,26 USD
Koszt zadania występuje tam, gdzie różnica w stosunku do GPT-6 Astra staje się wyraźna. Przy maksymalnym wysiłku Sztuczna Analiza ustala, że GPT-6.1 Sol wynosi 0,72 USD za zadanie Intelligence Index, czyli mniej niż jedną czwartą z 3,26 USD GPT-6 Astra. W porównaniu do swojego poprzednika oszczędności wynoszą 31 procent (1,05 dolara za GPT-6 Sol), a w porównaniu z GPT-5.6 Sol sięgają 64 procent (1,99 dolara).
Według firmy każdy poziom wysiłku GPT-6.1 Sol przesuwa granicę efektywności kosztowej w sensie Pareto — co oznacza, że dla danego poziomu inteligencji nie ma tańszej opcji wśród śledzonych przez niego modeli. Obraz wydajności tokena jest bardziej zróżnicowany: GPT-6.1 Sol zużywa około 10 do 30 procent więcej tokenów wyjściowych niż GPT-6 Sol na różnych poziomach wysiłku, chociaż jego ustawienia niskiego i średniego wysiłku pozostają optymalne w Pareto pod względem wydajności tokena po uwzględnieniu wyższej inteligencji. W kodowaniu model zyskał 3 punkty w porównaniu z GPT-6 Sol przy maksymalnym wysiłku w firmowym indeksie agenta kodującego.
Dlaczego siedmiodniowy czas realizacji ma znaczenie
Szersza oferta DevDay wzmacnia ten sam obraz. W raporcie CNET konferencję skupiono wokół trzech rzeczy, z których programiści mogliby od razu skorzystać — GPT-6.1 Sol, agentów Dots i przerobionych planów subskrypcji — a nie odległej zapowiedzi badań. Wiadomością dla programistów była dostępność dzisiaj, a nie możliwość jutro.
Flagowy model emituje ten krótki sygnał, że presja konkurencyjna przesunęła się z przebiegów szkoleniowych na udoskonalanie poszkoleniowe i infrastrukturę obsługującą. Aktualizacja na poziomie punktowym, która zostanie dostarczona w ciągu tygodnia, bardziej przypomina zoptymalizowany punkt kontrolny i nowy arkusz cen niż podstawowy model od zera, a konkurenci zachowują się w ten sam sposób: 30 września Google ogłosiło Gemini 4 Argon, model pionierski, który początkowo dociera do zaufanych cyberobronców za pośrednictwem programu Fairwind po tej samej stawce 2/10 dolarów za milion tokenów.
Ze zweryfikowanych liczb wynikają trzy praktyczne wnioski dla programistów. Po pierwsze, obciążenia agentowe z dużym ponownym wykorzystaniem pamięci podręcznej natychmiast korzystają z 95% zniżki na pamięć podręczną. Po drugie, budżety powinny modelować wyższe zużycie tokenów wyjściowych przed migracją, ponieważ cena za token pozostaje niezmieniona nawet wtedy, gdy model myśli dłużej. Po trzecie, Astra pozostaje pułapem dla zadań, w których ostatni punkt inteligencji jest wart 4-krotności kosztu — w przypadku GPT-6.1 Sol w przypadku większości prac tak nie jest.
Zastrzeżenie warte powtórzenia: dane te pochodzą od jednego niezależnego ewaluatora, niezależnie od rygorystycznej metodologii, a wyniki indeksów nagradzają określone obciążenia pracą. Zespoły z dużymi obciążeniami powinny ponownie przeprowadzić własne oceny przed przekierowaniem ruchu produkcyjnego.
---
Wyprzedź sztuczną inteligencjęOtrzymuj najnowsze wiadomości, analizy i przełomowe informacje dotyczące sztucznej inteligencji — wszystko w jednym miejscu.
Przeczytaj więcej aktualności o sztucznej inteligencji →