SpaceXAI lanza Grok 4.6: rendimiento a la altura y empatado en el tercer lugar mundial con GPT-5.6 Sol Max

La empresa de inteligencia artificial SpaceX AI, propiedad de Elon Musk, ha lanzado recientemente su nuevo modelo de vanguardia Grok 4.6. Este modelo está diseñado principalmente para agentes que operan durante largos períodos, programación y entornos de trabajo de conocimiento, y ha adoptado una estrategia de precios más competitiva para reducir los costos operativos de estas cargas de trabajo. En el índice de inteligencia de la agencia de evaluación externa Artificial Analysis, Grok 4.6 obtuvo una puntuación de 61, superando al modelo de código abierto Kimi K3 y empatando con el GPT-5.6 Sol Max de OpenAI, lo que representa una mejora de 5 puntos respecto a la versión anterior, Grok 4.5.

Actualmente, los dos primeros lugares de la lista son ocupados por Claude Opus 5 y Claude Fable 5 de Anthropic, mientras que Grok 4.6 y GPT-5.6 Sol Max comparten el tercer puesto a nivel mundial.

Las capacidades de programación y de agentes inteligentes son el enfoque principal de la actualización de Grok 4.6. En las pruebas de referencia DeepSWE v1.1, su puntuación aumentó del 54% al 65.9%; en la referencia de agentes APEX, la puntuación subió del 47.1% al 57.5%, un incremento de 10.4 puntos porcentuales, superando ligeramente el 56.7% de GPT-5.6 Sol Max; la puntuación en Terminal-Bench v3.0 también aumentó del 15.7% al 26%. Sin embargo, en estas dos últimas pruebas, Claude Fable 5 Max sigue manteniendo el liderazgo, lo que indica que, aunque Grok 4.6 ha progresado significativamente, aún no ha logrado una dominación total sobre sus competidores.

Grok 4.6 muestra competitividad en precios y rendimiento

En cuanto a precios, el costo inicial de la API de Grok 4.6 es de US$2 por cada millón de tokens de entrada (aproximadamente HK$16) y US$6 por cada millón de tokens de salida (aproximadamente HK$47), situándose en un rango medio para modelos de vanguardia, con precios que son menos de la mitad del modo estándar de GPT-5.6 Sol. Este modelo soporta una ventana de contexto de 500,000 tokens, y se cobra a las tarifas mencionadas cuando las indicaciones son inferiores a 200,000 tokens; después de alcanzar los 200,000 tokens, la tarifa se ajustará. Según SpaceX AI, Grok 4.6 está disponible desde hoy en Grok Build y también ha sido lanzado en la empresa de programación de IA Cursor, que han adquirido, junto con socios como OpenRouter,

Vercel y Cloudflare, entre otros.

En el ámbito del entrenamiento, SpaceX AI ha indicado que, en comparación con Grok 4.5, Grok 4.6 ha sido entrenado durante un período más prolongado y ha mejorado el aprendizaje reforzado en entornos de agentes para programación general, trabajo de conocimiento, optimización de núcleos, desarrollo web y diseño asistido por computadora. En las pruebas, Grok 4.6 mostró una mayor capacidad de autoevaluación y verificación en tareas de larga secuencia. Desde el punto de vista de la eficiencia de costos, los datos de Artificial Analysis muestran que Grok 4.6 completa la carga de trabajo AA-Briefcase con un promedio de solo 53 interacciones y 500 millones de tokens de entrada, mientras que Claude Opus 5 Max requiere aproximadamente 103 interacciones y 20

mil millones de tokens, lo que resalta claramente la ventaja de eficiencia del primero.

stone
stone