xAI ha rilasciato Grok 4.7, il modello più capace dell'azienda per il lavoro di codifica e conoscenza fino ad oggi, dopo settimane di prese in giro pubbliche e almeno un ritardo. Annunciato domenica sul sito dell'azienda, il modello arriva allo stesso prezzo e alla stessa velocità di servizio del suo predecessore Grok 4.6: 2 dollari per milione di token di input e 6 dollari per milione di token di output, circa la metà del prezzo di listino del GPT-5.6 Sol Max di OpenAI ($ 4/$ 20) e ben al di sotto di Fable 5.1 Max di Anthropic ($ 10/$ 50).
Per le ultime notizie e analisi sull'intelligenza artificiale, visita AI Buzz Wire.
Un modello base più grande, addestrato per compiti lunghi
Secondo l'annuncio di xAI, Grok 4.7 utilizza un nuovo modello base più grande rispetto a Grok 4.6 ed è stato addestrato con un percorso di apprendimento di rinforzo più lungo su un mix di compiti più difficili, ponderato verso problemi che richiedono molte ore per essere completati. L'azienda afferma che il modello è migliore nel verificare il proprio lavoro e nel gestire un contesto più lungo e che è stato addestrato per comprendere in modo nativo l'imbracatura di Grok Bot, migliorando le attività di conversazione e il lavoro di conoscenza generale.
Il rilascio segue una rumorosa rincorsa. Elon Musk aveva affermato per la prima volta all'inizio di settembre che Grok 4.7 sarebbe arrivato entro dieci giorni, poi ha riconosciuto a metà settembre che il modello aveva bisogno di qualche giorno in più per essere perfezionato, secondo TeslaNorth.com. È ora in spedizione e GitHub ha confermato lo stesso giorno che Grok 4.7 è disponibile in GitHub Copilot.
L'immagine di riferimento: forte, non travolgente
I dati benchmark pubblicati da xAI mostrano un modello che è leader in diverse categorie a lungo orizzonte, pur rimanendo indietro rispetto alla configurazione più costosa di Anthropic su altre:
- CursorBench 4.0, che sottolinea attività di codifica più lunghe: Grok 4.7 ottiene il 46,3%, davanti a GPT-5.6 Sol Max (41,7%) e Grok 4.6 High (40,4%), ma dietro Fable 5.1 Max (51,8%).
- Terminal-Bench 4.0, lavoro terminale di più ore: 38,0%, in netto aumento rispetto al 20,3% di Grok 4.6 e appena davanti a GPT-5.6 Sol Max (37,3%), anche se Fable 5.1 Max è in testa al 57,9%.
- EEBench, un benchmark di ingegneria elettrica: 64,0%, un grande salto dal 53,0% di Grok 4.6 e il più alto dei modelli elencati.
- DeepSWE v1.1: 71,0% ad alto sforzo, contro il 65,2% per Grok 4.6 e il 72,7% per GPT-5.6 Sol Max.
- Valigetta AA v1.1, lavoro d'ufficio di più ore: 1.657, in aumento rispetto a 1.546, e subito dopo Fable 5.1 Max a 1.678.
- Benchmark Harvey Legal Agent: 19,6%, davanti a Grok 4.6 (15,8%) e molto davanti a GPT-5.6 Sol Max (2,5%) e Fable 5.1 Max (6,7%) su questa misura.
- HealthBench Professional: 56,7%, in miglioramento rispetto al 48,5% di Grok 4.6 ma dietro a GPT-5.6 Sol Max (60,5%) e Fable 5.1 Max (62,1%).
Su GDPval, un benchmark professionale del lavoro di conoscenza valutato da Elo, il grafico di xAI colloca Grok 4.7 al ragionamento xhigh su 1.695 - rispetto a 1.605 per Grok 4.6, dietro Fable 5.1 Max (1.735) e davanti a GPT-6 Astra Max (1.542).
Il prezzo è la storia
L'affermazione più aggressiva nell'annuncio è economica piuttosto che tecnica: xAI descrive Grok 4.7 due volte più veloce alla metà del prezzo di modelli comparabili, e la tabella dei prezzi pubblicata conferma il confronto principale con le configurazioni di alto livello dei suoi due principali rivali. Il prezzo dei token da $ 2/$ 6 di Grok 4.7 è invariato rispetto a Grok 4.6, il che significa che gli acquirenti ottengono il miglioramento generazione dopo generazione senza un aumento di prezzo.
Questo posizionamento estende una strategia che xAI ha perseguito attraverso la linea Grok 4.x: abbinare o avvicinarsi alla qualità di frontiera riducendo al contempo i livelli di prezzo premium di OpenAI e Anthropic, quindi distribuire in modo aggressivo attraverso partner tra cui GitHub, Cursor e OpenRouter.
Cosa guardare
L’onesto avvertimento è che xAI ha pubblicato il grafico di confronto stesso e che la verifica indipendente da parte degli aggregatori di benchmarking richiederà giorni. Sui numeri che xAI ha scelto di evidenziare, Grok 4.7 è un vero passo avanti rispetto a Grok 4.6 – in modo più visibile su Terminal-Bench 4.0 ed EEBench – ma non spazza via Fable 5.1 Max, che mantiene il vantaggio sui benchmark di codifica e salute pur costando cinque volte di più per token di output.
Per gli sviluppatori che eseguono carichi di lavoro agenti di lunga durata, di più ore, il rapporto prezzo-prestazioni può essere più importante della semplice posizione in classifica. Grok 4.7 è ora disponibile tramite l'API di xAI e in GitHub Copilot.
Stai al passo con l'intelligenza artificiale
Per una copertura continua degli sviluppi più importanti del settore dell'intelligenza artificiale, aggiungi AI Buzz Wire ai preferiti e non perdere mai una notizia dell'ultima ora.
Leggi altre notizie sull'AI