Blog benchmarksGrok 4.6Gemini 3.7 Flashprecios APIArtificial Analysis

Grok 4.6 y Gemini 3.7 Flash: benchmarks y precios de agosto 2026

i

ia4·pro Team

Autor Especialista

Publicado el
Compartir

Grok 4.6 sube cinco puntos de índice sobre Grok 4.5

xAI publicó Grok 4.6 el 12 de agosto de 2026, 35 días después de Grok 4.5. Marca 61 puntos en el Artificial Analysis Intelligence Index, frente a los 56 de la versión anterior, y empata con GPT-5.6 Sol Max. Claude Opus 5 sigue primero con 63 y Claude Fable 5 segundo con 62.

El modelo usa la misma base V9 de 1,5 billones de parámetros que Grok 4.5. La mejora viene de ajuste supervisado y aprendizaje por refuerzo, no de una arquitectura nueva.

La tabla completa

Prueba Grok 4.6 Grok 4.5 GPT-5.6 Sol Max Fable 5 Max
AA Intelligence Index 61 56 61 62
GDPVal-AA v2 1753 1526 1728 1741
CursorBench v3.2 69,9% 66,7% 67,2% 70,5%
DeepSWE v1.1 65,9% 54% 73% 70%
FrontierCode v1.1 61,3% 56,6% 60,6% 63,6%
APEX-Agents 57,5% 47,1% 56,7% 59,2%
Terminal-Bench v3.0 26% 15,7% 34,6% 34,1%
APEX-SWE 56,4% 53,6% sin dato 58,8%
AA-Briefcase 1577 1313 1502 1574
Harvey LAB 15,8% 12,9% 2,5% 11,3%

Dos lecturas de esa tabla. Grok 4.6 gana en GDPVal-AA v2, AA-Briefcase y Harvey LAB, que son las pruebas de trabajo profesional y jurídico. Pierde con claridad en Terminal-Bench v3.0 y DeepSWE v1.1, las dos más ligadas a programación de terminal y resolución de incidencias reales.

El salto en Harvey LAB llama la atención: 15,8% contra el 2,5% de GPT-5.6 Sol. Es una prueba de trabajo legal, con puntuaciones bajas en toda la industria, así que el número absoluto importa menos que la distancia.

Contexto, precio y límites de Grok 4.6

Concepto Valor
Ventana de contexto 500.000 tokens
Modalidades texto e imagen a texto
Entrada 2,00$ por millón (4,00$ a partir de 200K)
Entrada cacheada 0,50$ por millón (1,00$ a partir de 200K)
Salida 6,00$ por millón (12,00$ a partir de 200K)
Peticiones por segundo 150
Tokens por minuto 50.000.000
Regiones us-east-1, us-west-2

El escalón de los 200.000 tokens es la parte que se cuela en las facturas. Si tu prompt cruza esa línea, todo el precio se dobla, tanto la entrada como la salida. Con 500K de ventana disponible, es fácil cruzarla sin darse cuenta en una sesión de agente larga. La variante rápida cuesta el doble de la estándar.

Grok 4.6 admite llamada a funciones, salidas estructuradas y razonamiento.

Gemini 3.7 Flash dobla su resultado en DeepSWE

Google publicó Gemini 3.7 Flash el 13 de agosto, menos de un mes después de 3.6 Flash, y lo describe como su modelo de trabajo más capaz para programación y agentes.

Prueba Gemini 3.7 Flash Gemini 3.6 Flash
DeepSWE v1.1 65,3% 49,0%
FrontierCode 1.1 43,6% 34,4%
AutomationBench 30,4% sin dato

En DeepSWE v1.1 queda por delante de Grok 4.6 (65,9% contra 65,3% es un empate técnico) a una fracción del precio. Mantiene 1.048.576 tokens de contexto y 64K de salida.

El precio de Gemini 3.7 Flash tiene fecha de caducidad

La tarifa de lanzamiento es 0,75$ de entrada y 3,75$ de salida por millón de tokens, la mitad de lo que costaba 3.6 Flash. Vence el 31 de diciembre de 2026 y a partir de esa fecha pasa a 1,50$ y 7,50$.

Si estás dimensionando el coste de un producto que se lanza en 2027, calcula con la tarifa alta. Si lo que haces es una prueba de concepto que termina en noviembre, el descuento es real.

Qué mide el Artificial Analysis Intelligence Index

El índice combina nueve evaluaciones: GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience y AA-LCR. Una puntuación única resume esas nueve, así que un modelo puede empatar en el índice y ser bastante distinto en la prueba que a ti te importa.

Los primeros puestos en agosto de 2026:

Modelo Índice
Claude Opus 5 (Max / Xhigh) 63
Claude Fable 5 (Max) 62
Grok 4.6 61
GPT-5.6 Sol Max 61
Qwen3.8-27B 52

Cómo elegir entre los dos

Grok 4.6 encaja cuando el trabajo es de análisis profesional largo y el volumen de tokens es moderado. Gemini 3.7 Flash encaja cuando hay mucho volumen y el trabajo es de programación o automatización, al menos hasta diciembre.

Ninguno de los dos desbanca a Claude Opus 5 en lo alto del índice. La comparativa completa está en /benchmarks y las fichas de cada herramienta en /tools.

Profundiza en este tema con IA

Copia un prompt pre-diseñado para continuar tu aprendizaje en tu herramienta favorita.

Ejecutar en tu Asistente

¿Cómo funciona? Al hacer clic en tu plataforma favorita, copiaremos el texto automáticamente y te llevaremos a su página. Solo tienes que pegar el texto (Ctrl+V o Cmd+V) en su chat para comenzar.

Compartir en Redes

Genera una publicación de LinkedIn de menos de 1500 caracteres, en tono natural y citando la fuente.

Dos pasos: primero lanza el prompt en tu asistente para generar el texto. Después abre LinkedIn y pega el resultado en el compositor.