Grok 4.6 y Gemini 3.7 Flash: benchmarks y precios de agosto 2026
ia4·pro Team
Autor Especialista
Grok 4.6 sube cinco puntos de índice sobre Grok 4.5
xAI publicó Grok 4.6 el 12 de agosto de 2026, 35 días después de Grok 4.5. Marca 61 puntos en el Artificial Analysis Intelligence Index, frente a los 56 de la versión anterior, y empata con GPT-5.6 Sol Max. Claude Opus 5 sigue primero con 63 y Claude Fable 5 segundo con 62.
El modelo usa la misma base V9 de 1,5 billones de parámetros que Grok 4.5. La mejora viene de ajuste supervisado y aprendizaje por refuerzo, no de una arquitectura nueva.
La tabla completa
| Prueba | Grok 4.6 | Grok 4.5 | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69,9% | 66,7% | 67,2% | 70,5% |
| DeepSWE v1.1 | 65,9% | 54% | 73% | 70% |
| FrontierCode v1.1 | 61,3% | 56,6% | 60,6% | 63,6% |
| APEX-Agents | 57,5% | 47,1% | 56,7% | 59,2% |
| Terminal-Bench v3.0 | 26% | 15,7% | 34,6% | 34,1% |
| APEX-SWE | 56,4% | 53,6% | sin dato | 58,8% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB | 15,8% | 12,9% | 2,5% | 11,3% |
Dos lecturas de esa tabla. Grok 4.6 gana en GDPVal-AA v2, AA-Briefcase y Harvey LAB, que son las pruebas de trabajo profesional y jurídico. Pierde con claridad en Terminal-Bench v3.0 y DeepSWE v1.1, las dos más ligadas a programación de terminal y resolución de incidencias reales.
El salto en Harvey LAB llama la atención: 15,8% contra el 2,5% de GPT-5.6 Sol. Es una prueba de trabajo legal, con puntuaciones bajas en toda la industria, así que el número absoluto importa menos que la distancia.
Contexto, precio y límites de Grok 4.6
| Concepto | Valor |
|---|---|
| Ventana de contexto | 500.000 tokens |
| Modalidades | texto e imagen a texto |
| Entrada | 2,00$ por millón (4,00$ a partir de 200K) |
| Entrada cacheada | 0,50$ por millón (1,00$ a partir de 200K) |
| Salida | 6,00$ por millón (12,00$ a partir de 200K) |
| Peticiones por segundo | 150 |
| Tokens por minuto | 50.000.000 |
| Regiones | us-east-1, us-west-2 |
El escalón de los 200.000 tokens es la parte que se cuela en las facturas. Si tu prompt cruza esa línea, todo el precio se dobla, tanto la entrada como la salida. Con 500K de ventana disponible, es fácil cruzarla sin darse cuenta en una sesión de agente larga. La variante rápida cuesta el doble de la estándar.
Grok 4.6 admite llamada a funciones, salidas estructuradas y razonamiento.
Gemini 3.7 Flash dobla su resultado en DeepSWE
Google publicó Gemini 3.7 Flash el 13 de agosto, menos de un mes después de 3.6 Flash, y lo describe como su modelo de trabajo más capaz para programación y agentes.
| Prueba | Gemini 3.7 Flash | Gemini 3.6 Flash |
|---|---|---|
| DeepSWE v1.1 | 65,3% | 49,0% |
| FrontierCode 1.1 | 43,6% | 34,4% |
| AutomationBench | 30,4% | sin dato |
En DeepSWE v1.1 queda por delante de Grok 4.6 (65,9% contra 65,3% es un empate técnico) a una fracción del precio. Mantiene 1.048.576 tokens de contexto y 64K de salida.
El precio de Gemini 3.7 Flash tiene fecha de caducidad
La tarifa de lanzamiento es 0,75$ de entrada y 3,75$ de salida por millón de tokens, la mitad de lo que costaba 3.6 Flash. Vence el 31 de diciembre de 2026 y a partir de esa fecha pasa a 1,50$ y 7,50$.
Si estás dimensionando el coste de un producto que se lanza en 2027, calcula con la tarifa alta. Si lo que haces es una prueba de concepto que termina en noviembre, el descuento es real.
Qué mide el Artificial Analysis Intelligence Index
El índice combina nueve evaluaciones: GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience y AA-LCR. Una puntuación única resume esas nueve, así que un modelo puede empatar en el índice y ser bastante distinto en la prueba que a ti te importa.
Los primeros puestos en agosto de 2026:
| Modelo | Índice |
|---|---|
| Claude Opus 5 (Max / Xhigh) | 63 |
| Claude Fable 5 (Max) | 62 |
| Grok 4.6 | 61 |
| GPT-5.6 Sol Max | 61 |
| Qwen3.8-27B | 52 |
Cómo elegir entre los dos
Grok 4.6 encaja cuando el trabajo es de análisis profesional largo y el volumen de tokens es moderado. Gemini 3.7 Flash encaja cuando hay mucho volumen y el trabajo es de programación o automatización, al menos hasta diciembre.
Ninguno de los dos desbanca a Claude Opus 5 en lo alto del índice. La comparativa completa está en /benchmarks y las fichas de cada herramienta en /tools.
Profundiza en este tema con IA
Copia un prompt pre-diseñado para continuar tu aprendizaje en tu herramienta favorita.
Ejecutar en tu Asistente
Compartir en Redes
Genera una publicación de LinkedIn de menos de 1500 caracteres, en tono natural y citando la fuente.
Lleva la teoría a la práctica
Aplica lo que lees con cursos 100% gratuitos y orientados a resultados reales.