xAI випустила Grok 4.7, найефективнішу модель компанії для програмування та роботи з знаннями на сьогоднішній день, після тижнів публічного дражнення та принаймні однієї затримки. Модель, оголошена на сайті компанії в неділю, має ту саму ціну та швидкість обслуговування, що й її попередник Grok 4.6: 2 долари США за мільйон вхідних токенів і 6 доларів США за мільйон вихідних токенів, що приблизно вдвічі нижче за прейскурант OpenAI GPT-5.6 Sol Max (4$/20$) і значно нижче Fable 5.1 Max від Anthropic (10/50$).

Щоб переглянути останні новини та аналіз ШІ, відвідайте AI Buzz Wire.

Більша базова модель, навчена виконувати довгі завдання

Згідно з оголошенням xAI, Grok 4.7 використовує нову, більшу базову модель порівняно з Grok 4.6, і її було навчено за допомогою більш тривалого підсилювального навчання на складнішій суміші завдань, зважених на проблеми, на виконання яких потрібно багато годин. Компанія каже, що модель краще перевіряє свою власну роботу та керує довшим контекстом, і що її навчили нативно розуміти систему Grok Bot, покращуючи розмовні завдання та загальні знання.

Реліз слідує за гучним розбігом. На початку вересня Ілон Маск вперше заявив, що Grok 4.7 приземлиться протягом десяти днів, а в середині вересня визнав, що модель потребує ще кількох днів доопрацювання, повідомляє TeslaNorth.com. Зараз він поставляється, і того ж дня GitHub підтвердив, що Grok 4.7 доступний у GitHub Copilot.

Еталонне зображення: потужне, не різке

Порівняльні дані, опубліковані xAI, демонструють модель, яка лідирує в кількох довгострокових категоріях, залишаючись за найдорожчою конфігурацією Anthropic в інших:

  • CursorBench 4.0, який наголошує на довготривалих завданнях кодування: Grok 4.7 набирає 46,3%, випереджаючи GPT-5.6 Sol Max (41,7%) і Grok 4.6 High (40,4%), але поступаючись Fable 5.1 Max (51,8%).
  • Terminal-Bench 4.0, багатогодинна робота на терміналі: 38,0%, різке зростання порівняно з 20,3% для Grok 4.6 і трохи попереду GPT-5.6 Sol Max (37,3%), хоча Fable 5.1 Max лідирує з 57,9%.
  • EEBench, тест електротехніки: 64,0%, значний стрибок порівняно з Grok 4.6 (53,0%) і найвищий показник серед перерахованих моделей.
  • DeepSWE v1.1: 71,0% при великих зусиллях проти 65,2% для Grok 4.6 і 72,7% для GPT-5.6 Sol Max.
  • AA Briefcase v1.1, багатогодинна офісна робота: 1657, порівняно з 1546, і майже позаду Fable 5.1 Max з 1678.
  • Harvey Legal Agent Benchmark: 19,6%, випереджаючи Grok 4.6 (15,8%) і значно випереджаючи GPT-5.6 Sol Max (2,5%) і Fable 5.1 Max (6,7%) за цим показником.
  • HealthBench Professional: 56,7%, що покращує Grok 4.6 (48,5%), але відстає від GPT-5.6 Sol Max (60,5%) і Fable 5.1 Max (62,1%).

На GDPval, професійному тесті знань і роботи, який оцінює Elo, діаграма xAI ставить Grok 4.7 при xhigh аргументації на 1695 — порівняно з 1605 для Grok 4.6, позаду Fable 5.1 Max (1735) і попереду GPT-6 Astra Max (1542).

Ціна - це історія

Найагресивніша заява в оголошенні є економічною, а не технічною: xAI описує Grok 4.7 як удвічі швидший за удвічі нижчу ціну порівнянних моделей, а опублікована таблиця цін підтверджує порівняння заголовків із конфігураціями найвищого рівня двох головних конкурентів. Ціна токена Grok 4.7 $2/$6 не змінилася порівняно з Grok 4.6, тобто покупці отримують покращення кожного покоління без підвищення ціни.

Таке позиціонування розширює стратегію, яку xAI дотримувався в лінійці Grok 4.x: відповідність або наближення до граничної якості, знижуючи преміум-рівень цін OpenAI і Anthropic, а потім агресивно розповсюджуйте через партнерів, зокрема GitHub, Cursor і OpenRouter.

Що подивитися

Чесне застереження полягає в тому, що xAI сам опублікував порівняльну таблицю, а незалежна перевірка від агрегаторів порівняльного аналізу займе кілька днів. У цифрах, які xAI вирішив висвітлити, Grok 4.7 є справжнім кроком вперед у порівнянні з Grok 4.6 — найбільш помітним у Terminal-Bench 4.0 та EEBench — але він не випереджає Fable 5.1 Max, який зберігає лідерство в тестах кодування та працездатності, але коштує в п’ять разів більше за вихідний токен.

Для розробників, які виконують довгі багатогодинні агентські робочі навантаження, співвідношення ціна-продуктивність може мати більше значення, ніж чиста позиція в таблиці лідерів. Grok 4.7 доступний через API xAI і GitHub Copilot.

Будьте попереду ШІ

Щоб постійно висвітлювати найважливіші події індустрії штучного інтелекту, додайте закладку AI Buzz Wire і ніколи не пропускайте актуальну історію.

Читати більше новин AI