Volver al Blog
Modelos de IA 14 de agosto de 2026 5 min read

xAI Lanza Grok 4.6, Iguala a GPT-5.6 en Benchmarks a la Mitad del Precio de sus Rivales de Frontera

Grok 4.6 obtiene 61 puntos en el Artificial Analysis Intelligence Index, empatando con GPT-5.6 Sol Max, con un precio de $2/$6 por millón de tokens que supera a Claude Opus y GPT-5.6. SWE-bench subió 9 puntos frente a Grok 4.5.

xAI Lanza Grok 4.6, Iguala a GPT-5.6 en Benchmarks a la Mitad del Precio de sus Rivales de Frontera

xAI lanzó Grok 4.6 el 12 de agosto, y la cifra que importa es 61 — su puntuación en el Artificial Analysis Intelligence Index, empatando con GPT-5.6 Sol Max a una fracción del precio. El precio estándar es de $2 por millón de tokens de entrada y $6 por millón de salida; las solicitudes de más de 200.000 tokens suben a $4/$12. Una variante más rápida cuesta el doble. En cualquier caso, queda por debajo de GPT-5.6 y Claude Opus en costo mientras iguala su posicionamiento en el benchmark compuesto que los rivales de xAI usan para vender liderazgo de frontera.

El salto más grande está en SWE-bench Verified, donde Grok 4.6 alcanza 95.60% — unos 9 puntos más que Grok 4.5 y el resultado de codificación verificado más fuerte que xAI ha publicado. xAI construyó el lanzamiento en torno al trabajo agéntico de larga duración: mantener la coherencia en tareas de muchos pasos, ya sea investigar un tema de principio a fin, navegar por un código base desconocido, o convertir una idea a medio formar en una aplicación funcional sin perder el hilo. El modelo acepta texto e imagen, tiene una ventana de contexto de 500.000 tokens, y llega con llamadas a funciones, salidas estructuradas, búsqueda web, búsqueda en X y ejecución de código integradas en la API.

Esa ventana de contexto importa más que el benchmark titular para cualquiera que construya agentes. La mayoría de los fallos de los agentes de codificación no son fallos de razonamiento — son fallos de contexto, cuando el modelo pierde de vista un archivo que editó tres llamadas de herramienta antes. 500K tokens le dan a Grok 4.6 espacio para mantener un código base de tamaño medio junto con su propio borrador de trabajo sin resumir de forma agresiva, la misma apuesta que hizo Anthropic con el contexto extendido de Claude y OpenAI con el nivel de contexto largo de GPT-5.6.

El movimiento de precios es la historia más relevante para el mercado. Que Grok 4.6 aterrice en $2/$6 igualando a un campo que cuesta $2/$6 en adelante y con la misma puntuación de inteligencia continúa una guerra de precios que lleva todo el verano en marcha — OpenAI recortó el precio de GPT-5.6 Luna un 80% hasta $0.20/$1.20 por millón de tokens a principios de agosto, y DeepSeek lanzó V4-Flash a $0.14/$0.28 la misma semana. La capacidad de frontera ya no es el diferenciador que era hace un año; todos los laboratorios del nivel superior se agrupan ahora a pocos puntos entre sí en Artificial Analysis, lo que convierte al precio y a la fiabilidad de los agentes en el verdadero campo de batalla.

Para los desarrolladores que ya construyen sobre Grok, 4.6 es una actualización directa — misma superficie de API, un SWE-bench notablemente mejor, sin razón para esperar. Para los equipos que eligen un modelo desde cero, ahora es genuinamente difícil justificar pagar más por un modelo de frontera solo por capacidad. La brecha que solía existir entre “el modelo inteligente” y “el modelo barato” se ha cerrado en gran parte.

Fuentes

xAI Grok AI models benchmarks