Grok 4.5, Gemini 3.6 Flash y DeepSeek V4: benchmarks de julio 2026
ia4·pro Team
Autor Especialista
Cuatro lanzamientos en una semana
La segunda mitad de julio dejó una tanda de modelos que reordena la tabla. Grok 4.5 llegó centrado en código, Google publicó tres Gemini Flash de golpe, DeepSeek pasó su V4 a estable y Kimi K3 irrumpió por arriba en programación. La foto del sector cambia cada pocas semanas, y esta ha sido de las más cargadas del verano.
Grok 4.5: el giro de xAI hacia el código
Grok 4.5 es el primer modelo de xAI pensado para programación y tareas de agente. Lo entrenaron con sesiones reales de desarrolladores en Cursor, y ese origen se nota en cómo aborda el trabajo de código real. Saca 64,7% en SWE-bench Pro, por detrás de Claude Fable 5 (cerca del 80%) y en línea con GPT-5.6 Sol.
El contexto baja a 500K tokens, la mitad que la generación anterior, y ese es su único recorte claro. A cambio, cuesta 2 $/6 $ por millón de tokens de entrada y salida, cerca de una cuarta parte del precio de salida de Opus 4.8, y resuelve cada tarea con unas cuatro veces menos tokens. Es el modelo por defecto de Grok Build, donde genera hojas de Excel, presentaciones y documentos de Word.
Gemini 3.6 Flash y el resto de la gama rápida
Google publicó el 22 de julio tres variantes: Gemini 3.5 Flash Cyber, orientada a seguridad; Gemini 3.5 Flash-Lite, la más económica; y Gemini 3.6 Flash, la actualización general de la línea rápida. La familia Flash sigue siendo la referencia de velocidad y precio, con 2M de contexto y la integración con Google Workspace como principal ventaja para quien ya vive en ese ecosistema.
DeepSeek V4: barato y estable
DeepSeek V4 dejó la fase de preview el 24 de julio con precio de salida de unos 0,44 $ por millón de tokens y licencia MIT. Es de las formas más baratas de acceder a un modelo capaz en código y matemáticas, y su versión estable lo hace apto para producción, no solo para pruebas.
La tabla comparativa
Con los números sobre la mesa, así queda el trabajo de código a mediados de julio de 2026.
| Modelo | SWE-bench Pro | Contexto | Precio salida (por M) |
|---|---|---|---|
| Claude Fable 5 | ~80% | 200K | 50 $ |
| Claude Opus 4.8 | 69,2% | 200K | 25 $ |
| Grok 4.5 | 64,7% | 500K | 6 $ |
| GPT-5.6 Sol | 64,6% | 1M | 30 $ |
| DeepSeek V4 | vendor | — | 0,44 $ |
La conclusión no apunta a un ganador único. Claude Fable 5 sigue por delante en código difícil de una sola pasada, pero pagas por ello. Grok 4.5 y DeepSeek V4 dan un rendimiento cercano por una fracción del coste, y ahí está la decisión real para la mayoría de equipos.
Cómo elegir sin obsesionarte con la tabla
Un número alto en un benchmark no garantiza que el modelo resuelva mejor tu problema. La regla práctica es sencilla: para código difícil que no admite errores, prueba primero Claude. Para volumen de trabajo donde el coste manda, DeepSeek V4 y Grok 4.5 rinden de sobra. Y si ya usas Cursor, Grok 4.5 encaja de forma natural en ese flujo.
Antes de cambiar tu modelo por defecto, pásale tus propias tareas y compara. Para eso tienes la tabla completa y actualizada en benchmarks, y en herramientas el listado de dónde usar cada uno.
Profundiza en este tema con IA
Copia un prompt pre-diseñado para continuar tu aprendizaje en tu herramienta favorita.
Ejecutar en tu Asistente
Lleva la teoría a la práctica
Aplica lo que lees con cursos 100% gratuitos y orientados a resultados reales.