xAI wypuściło Grok 4.7, najpotężniejszy jak dotąd model firmy do kodowania i pracy z wiedzą, po tygodniach publicznych dokuczań i co najmniej jednym opóźnieniu. Ogłoszony w niedzielę na stronie internetowej firmy, model będzie dostępny w tej samej cenie i szybkości działania, co jego poprzednik Grok 4.6: 2 dolary za milion tokenów wejściowych i 6 dolarów za milion tokenów wyjściowych, czyli mniej więcej połowę ceny katalogowej OpenAI GPT-5.6 Sol Max (4/20 dolarów) i znacznie poniżej Anthropic's Fable 5.1 Max (10/50 dolarów).
Najnowsze wiadomości i analizy dotyczące sztucznej inteligencji można znaleźć na stronie AI Buzz Wire.
Większy model podstawowy, przeszkolony do długich zadań
Zgodnie z zapowiedzią xAI, Grok 4.7 wykorzystuje nowy, większy model podstawowy w porównaniu z Grok 4.6 i został przeszkolony w ramach dłuższego uczenia się przez wzmacnianie, obejmującego trudniejszą mieszankę zadań, skupioną wokół problemów, których wykonanie zajmuje wiele godzin. Firma twierdzi, że model lepiej radzi sobie z weryfikacją własnej pracy i zarządzaniem dłuższym kontekstem, a także że został przeszkolony w zakresie natywnego rozumienia uprzęży Grok Bot, usprawniania zadań konwersacyjnych i pracy z wiedzą ogólną.
Wydanie następuje po hałaśliwym okresie przygotowań. Elon Musk najpierw powiedział na początku września, że Grok 4.7 wyląduje w ciągu dziesięciu dni, a w połowie września przyznał, że według TeslaNorth.com model wymaga jeszcze kilku dni dopracowania. Jest już dostarczany, a GitHub tego samego dnia potwierdził, że Grok 4.7 jest dostępny w GitHub Copilot.
Obraz porównawczy: mocny, niezbyt imponujący
Dane porównawcze opublikowane przez xAI pokazują model, który prowadzi w kilku długoterminowych kategoriach, a w innych pozostaje w tyle za najdroższą konfiguracją Anthropic:
- CursorBench 4.0, który kładzie nacisk na dłuższe zadania kodowania: Grok 4.7 uzyskał 46,3%, wyprzedzając GPT-5.6 Sol Max (41,7%) i Grok 4.6 High (40,4%), ale za Fable 5.1 Max (51,8%).
- Terminal-Bench 4.0, wielogodzinna praca terminala: 38,0%, gwałtowny wzrost z 20,3% dla Grok 4.6 i tuż przed GPT-5.6 Sol Max (37,3%), choć Fable 5.1 Max prowadzi z wynikiem 57,9%.
- EEBench, benchmark inżynierii elektrycznej: 64,0%, duży skok w porównaniu z 53,0% Groka 4.6 i najwyższy z wymienionych modeli.
- DeepSWE v1.1: 71,0% przy dużym wysiłku, w porównaniu do 65,2% dla Grok 4.6 i 72,7% dla GPT-5.6 Sol Max.
- AA Aktówka v1.1, wielogodzinna praca biurowa: 1657, w porównaniu z 1546 i tuż za Fable 5.1 Max przy 1678.
- Harvey Legal Agent Benchmark: 19,6%, przed Grokiem 4,6 (15,8%) i znacznie przed GPT-5.6 Sol Max (2,5%) i Fable 5.1 Max (6,7%) pod tym względem.
- HealthBench Professional: 56,7%, poprawa w stosunku do Groka 4.6 o 48,5%, ale gorsza od GPT-5.6 Sol Max (60,5%) i Fable 5.1 Max (62,1%).
Na PKBval, profesjonalnym benchmarku pracy opartym na wiedzy, ocenionym przez Elo, wykres xAI stawia Grok 4,7 na poziomie xhigh na poziomie 1695 — w porównaniu z 1605 dla Grok 4.6, za Fable 5.1 Max (1735) i przed GPT-6 Astra Max (1542).
Cena to historia
Najbardziej agresywne twierdzenie zawarte w ogłoszeniu ma raczej charakter ekonomiczny niż techniczny: xAI opisuje Grok 4.7 jako dwukrotnie szybszy za połowę ceny porównywalnych modeli, a opublikowana tabela cen potwierdza główne porównanie z konfiguracjami z najwyższej półki jego dwóch głównych rywali. Ceny tokenów Grok 4.7 wynoszące 2/6 USD pozostają niezmienione w porównaniu z Grok 4.6, co oznacza, że kupujący uzyskują poprawę z pokolenia na pokolenie bez wzrostu ceny.
To pozycjonowanie rozszerza strategię realizowaną przez xAI w całej linii Grok 4.x: dopasowuj lub zbliżaj się do granicznej jakości, jednocześnie podcinając najwyższe poziomy cenowe OpenAI i Anthropic, a następnie agresywnie dystrybuuj za pośrednictwem partnerów, w tym GitHub, Cursor i OpenRouter.
Co obejrzeć
Szczerym zastrzeżeniem jest to, że xAI opublikowało samą tabelę porównawczą, a niezależna weryfikacja przez agregatory benchmarków zajmie kilka dni. Jeśli chodzi o liczby, które xAI zdecydowało się podkreślić, Grok 4.7 stanowi prawdziwy krok naprzód w stosunku do Groka 4.6 — co jest najbardziej widoczne w Terminal-Bench 4.0 i EEBench — ale nie pokonuje Fable 5.1 Max, który utrzymuje przewagę w testach kodowania i kondycji, a jednocześnie kosztuje pięć razy więcej za token wyjściowy.
W przypadku programistów obsługujących długie, wielogodzinne obciążenia agentowe obliczenia ceny i wydajności mogą mieć większe znaczenie niż surowa pozycja w tabeli liderów. Grok 4.7 jest już dostępny poprzez API xAI oraz w GitHub Copilot.
Wyprzedź sztuczną inteligencję
Aby na bieżąco informować o najważniejszych wydarzeniach w branży sztucznej inteligencji, dodaj zakładkę AI Buzz Wire, aby nigdy nie przegapić przełomowej historii.
Przeczytaj więcej aktualności na temat sztucznej inteligencji