xAI lanzó Grok 4.7, el modelo más capaz de la compañía para codificación y trabajo de conocimiento hasta la fecha, después de semanas de burlas públicas y al menos un retraso. Anunciado en el sitio de la compañía el domingo, el modelo tiene el mismo precio y velocidad de servicio que su predecesor Grok 4.6: $2 por millón de tokens de entrada y $6 por millón de tokens de salida, aproximadamente la mitad del precio de lista del GPT-5.6 Sol Max de OpenAI ($4/$20) y muy por debajo del Fable 5.1 Max de Anthropic ($10/$50).
Para conocer las últimas noticias y análisis sobre IA, visite AI Buzz Wire.
Un modelo base más grande, capacitado para tareas largas
Según el anuncio de xAI, Grok 4.7 utiliza un modelo base nuevo y más grande en comparación con Grok 4.6 y fue entrenado con una ejecución de aprendizaje por refuerzo más larga en una combinación más difícil de tareas, orientada a problemas que tardan muchas horas en completarse. La compañía dice que el modelo es mejor para verificar su propio trabajo y gestionar un contexto más amplio, y que fue entrenado para comprender de forma nativa el arnés Grok Bot, mejorando las tareas conversacionales y el trabajo de conocimiento general.
El lanzamiento sigue a un ruidoso período previo. Elon Musk dijo por primera vez a principios de septiembre que Grok 4.7 aterrizaría en diez días, luego reconoció a mediados de septiembre que el modelo necesitaba unos días más de refinamiento, según TeslaNorth.com. Ya se está enviando y GitHub confirmó el mismo día que Grok 4.7 está disponible en GitHub Copilot.
La imagen de referencia: fuerte, no arrolladora
Los datos de referencia publicados por xAI muestran un modelo que lidera en varias categorías de largo plazo mientras se mantiene detrás de la configuración más cara de Anthropic en otras:
- CursorBench 4.0, que enfatiza tareas de codificación de mayor duración: Grok 4.7 obtiene una puntuación del 46,3%, por delante de GPT-5.6 Sol Max (41,7%) y Grok 4.6 High (40,4%), pero detrás de Fable 5.1 Max (51,8%).
- Terminal-Bench 4.0, trabajo terminal de varias horas: 38,0%, muy por encima del 20,3% de Grok 4.6 y justo por delante de GPT-5.6 Sol Max (37,3%), aunque Fable 5.1 Max lidera con un 57,9%.
- EEBench, un punto de referencia de ingeniería eléctrica: 64,0%, un gran salto con respecto al 53,0% de Grok 4.6 y el más alto de los modelos enumerados.
- DeepSWE v1.1: 71,0% con alto esfuerzo, frente al 65,2% de Grok 4.6 y el 72,7% de GPT-5.6 Sol Max.
- AA Briefcase v1.1, trabajo de oficina de varias horas: 1657, frente a 1546, y muy cerca de Fable 5.1 Max con 1678.
- Harvey Legal Agent Benchmark: 19,6%, por delante de Grok 4.6 (15,8%) y muy por delante de GPT-5.6 Sol Max (2,5%) y Fable 5.1 Max (6,7%) en esta medida.
- HealthBench Professional: 56,7%, mejorando el 48,5% de Grok 4.6 pero detrás de GPT-5.6 Sol Max (60,5%) y Fable 5.1 Max (62,1%).
En GDPval, un punto de referencia de trabajo de conocimiento profesional calificado por Elo, el gráfico de xAI coloca a Grok 4.7 en un razonamiento xalto con 1.695, frente a 1.605 para Grok 4.6, detrás de Fable 5.1 Max (1.735) y por delante de GPT-6 Astra Max (1.542).
El precio es la historia
La afirmación más agresiva del anuncio es más económica que técnica: xAI describe a Grok 4.7 como dos veces más rápido a la mitad del precio de modelos comparables, y la tabla de precios publicada respalda la comparación principal con las configuraciones de primer nivel de sus dos principales rivales. El precio del token de $2/$6 de Grok 4.7 no ha cambiado con respecto al de Grok 4.6, lo que significa que los compradores obtienen la mejora de generación tras generación sin un aumento de precio.
Ese posicionamiento extiende una estrategia que xAI ha seguido en toda la línea Grok 4.x: igualar o acercarse a la calidad de frontera mientras rebaja los niveles de precios premium de OpenAI y Anthropic, y luego distribuir agresivamente a través de socios como GitHub, Cursor y OpenRouter.
Qué mirar
La advertencia honesta es que xAI publicó el cuadro comparativo y la verificación independiente por parte de agregadores de evaluaciones comparativas llevará días. En los números que xAI decidió resaltar, Grok 4.7 es un verdadero paso adelante con respecto a Grok 4.6, más visiblemente en Terminal-Bench 4.0 y EEBench, pero no supera a Fable 5.1 Max, que mantiene el liderazgo en codificación y puntos de referencia de salud y cuesta cinco veces más por token de salida.
Para los desarrolladores que ejecutan cargas de trabajo de agentes largas y de varias horas, la matemática precio-rendimiento puede ser más importante que la posición bruta en la tabla de clasificación. Grok 4.7 ya está disponible a través de la API de xAI y en GitHub Copilot.
Manténgase por delante de la IA
Para una cobertura continua de los desarrollos más importantes de la industria de la IA, marque AI Buzz Wire y no se pierda nunca una noticia de última hora.
Leer más noticias sobre IA