ia4·pro
Blog Grok 4.5Gemini 3.6 FlashDeepSeek V4benchmarks IAmodelos IA

Grok 4.5, Gemini 3.6 Flash y DeepSeek V4: benchmarks de julio 2026

i

ia4·pro Team

Autor Especialista

Publicado el
Compartir

Cuatro lanzamientos en una semana

La segunda mitad de julio dejó una tanda de modelos que reordena la tabla. Grok 4.5 llegó centrado en código, Google publicó tres Gemini Flash de golpe, DeepSeek pasó su V4 a estable y Kimi K3 irrumpió por arriba en programación. La foto del sector cambia cada pocas semanas, y esta ha sido de las más cargadas del verano.

Grok 4.5: el giro de xAI hacia el código

Grok 4.5 es el primer modelo de xAI pensado para programación y tareas de agente. Lo entrenaron con sesiones reales de desarrolladores en Cursor, y ese origen se nota en cómo aborda el trabajo de código real. Saca 64,7% en SWE-bench Pro, por detrás de Claude Fable 5 (cerca del 80%) y en línea con GPT-5.6 Sol.

El contexto baja a 500K tokens, la mitad que la generación anterior, y ese es su único recorte claro. A cambio, cuesta 2 $/6 $ por millón de tokens de entrada y salida, cerca de una cuarta parte del precio de salida de Opus 4.8, y resuelve cada tarea con unas cuatro veces menos tokens. Es el modelo por defecto de Grok Build, donde genera hojas de Excel, presentaciones y documentos de Word.

Gemini 3.6 Flash y el resto de la gama rápida

Google publicó el 22 de julio tres variantes: Gemini 3.5 Flash Cyber, orientada a seguridad; Gemini 3.5 Flash-Lite, la más económica; y Gemini 3.6 Flash, la actualización general de la línea rápida. La familia Flash sigue siendo la referencia de velocidad y precio, con 2M de contexto y la integración con Google Workspace como principal ventaja para quien ya vive en ese ecosistema.

DeepSeek V4: barato y estable

DeepSeek V4 dejó la fase de preview el 24 de julio con precio de salida de unos 0,44 $ por millón de tokens y licencia MIT. Es de las formas más baratas de acceder a un modelo capaz en código y matemáticas, y su versión estable lo hace apto para producción, no solo para pruebas.

La tabla comparativa

Con los números sobre la mesa, así queda el trabajo de código a mediados de julio de 2026.

Modelo SWE-bench Pro Contexto Precio salida (por M)
Claude Fable 5 ~80% 200K 50 $
Claude Opus 4.8 69,2% 200K 25 $
Grok 4.5 64,7% 500K 6 $
GPT-5.6 Sol 64,6% 1M 30 $
DeepSeek V4 vendor 0,44 $

La conclusión no apunta a un ganador único. Claude Fable 5 sigue por delante en código difícil de una sola pasada, pero pagas por ello. Grok 4.5 y DeepSeek V4 dan un rendimiento cercano por una fracción del coste, y ahí está la decisión real para la mayoría de equipos.

Cómo elegir sin obsesionarte con la tabla

Un número alto en un benchmark no garantiza que el modelo resuelva mejor tu problema. La regla práctica es sencilla: para código difícil que no admite errores, prueba primero Claude. Para volumen de trabajo donde el coste manda, DeepSeek V4 y Grok 4.5 rinden de sobra. Y si ya usas Cursor, Grok 4.5 encaja de forma natural en ese flujo.

Antes de cambiar tu modelo por defecto, pásale tus propias tareas y compara. Para eso tienes la tabla completa y actualizada en benchmarks, y en herramientas el listado de dónde usar cada uno.

Profundiza en este tema con IA

Copia un prompt pre-diseñado para continuar tu aprendizaje en tu herramienta favorita.

Ejecutar en tu Asistente

💡 ¿Cómo funciona? Al hacer clic en tu plataforma favorita, copiaremos el texto automáticamente y te llevaremos a su página. Solo tienes que pegar el texto (Ctrl+V o Cmd+V) en su chat para comenzar.