Blog benchmarksmodelosDeepSeekGLMQwen

DeepSeek V4-Pro y GLM-5.2 Turbo: los benchmarks de agosto 2026

i

ia4·pro Team

Autor Especialista

Publicado el
Compartir

Doce modelos en veinte días

Agosto de 2026 lleva doce modelos publicados por siete proveedores. El ritmo supera lo que cualquier equipo puede evaluar: para cuando terminas de medir uno ya han salido dos más.

Para elegir pesan el ajuste a la tarea, el coste de cambiar de proveedor y el control que te queda sobre el despliegue. El titular del lanzamiento no dice nada de eso.

DeepSeek V4-Pro llega a disponibilidad general

DeepSeek V4-Pro-0813 salió el 13 de agosto y pasó a disponibilidad general con el cambio de tarifas del día 16. Está accesible por API y en el modo Experto de la app y la web.

Es el modelo con el que DeepSeek compite en programación y en agentes largos, y la referencia de valor en pesos abiertos junto a Kimi K3, que Moonshot publicó en julio con 2,8 billones de parámetros.

El cambio de precios importa tanto como el modelo. La entrada cuesta 0,66$ por millón fuera de hora punta y 1,32$ dentro. La salida, 1,98$ y 3,96$. Lo desglosamos en el análisis de precios de esta semana.

GLM-5.2 Turbo y las cifras de Terminal-Bench

Z.ai publicó GLM-5.2 Turbo el 17 de agosto sobre una base de 743.000 millones de parámetros. Los números que da la empresa son 81,0 en Terminal-Bench 2.1 y 62,1 en SWE-bench Pro.

Tres días antes había salido GLM-5.3, con 60 puntos en el Artificial Analysis Intelligence Index y un precio de 1,40$ de entrada y 4,40$ de salida por millón. Esa combinación le da el coste por tarea terminada más bajo de cualquier modelo de frontera, que es la métrica que más pesa cuando ejecutas agentes que encadenan decenas de llamadas.

Qwen3.8-Max: 2,4 billones de parámetros solo por API

Alibaba publicó Qwen3.8-Max el 2 de agosto como su modelo insignia, con 2,4 billones de parámetros y disponible solo por API. La versión abierta llegó el 14 con Qwen3.8-27B, bajo licencia Apache 2.0.

La separación entre un tope cerrado por API y una versión abierta más pequeña se ha convertido en el patrón habitual de Alibaba, Z.ai y DeepSeek. Te dan pesos suficientes para desplegar dentro de casa y reservan el modelo grande para el servicio de pago.

Nemotron 3.5 Lightning y los modelos pequeños

NVIDIA mantiene la línea Nemotron 3.5, que va del Nano-30B al Ultra-550B con 1 millón de tokens de contexto. La encabeza ahora Lightning-30B-A3B, orientado a agentes, con arquitectura de expertos que activa 3.000 millones de parámetros por token.

Liquid AI publicó LFM2.5-2.6B el 4 de agosto para despliegue en dispositivo y agentes ligeros. Es la parte del mercado que menos titulares genera y más se está moviendo: modelos que corren en un portátil o un móvil sin llamar a ninguna API.

La tabla general de agosto

Modelo Índice de referencia Precio entrada / salida Contexto
GPT-5.6 Sol 57,2 (LLM Stats) según plan 400.000
Claude Opus 5 56,5 (LLM Stats), 1691 Elo en WebDev Arena según plan 500.000
Claude Fable 5 56,3 (LLM Stats) según plan 500.000
Grok 4.6 61 (Artificial Analysis) 2$ / 6$ 500.000
GLM-5.3 60 (Artificial Analysis) 1,40$ / 4,40$ base GLM-5.2
DeepSeek V4-Pro referencia en pesos abiertos 0,66$–1,32$ / 1,98$–3,96$ según despliegue
Qwen3.8-27B pesos abiertos Apache 2.0 despliegue propio 262.144 (hasta 1M)

Los dos índices no son comparables entre sí: LLM Stats y Artificial Analysis usan baterías distintas y escalas distintas. Compara dentro de cada columna, no entre ellas.

Qué usar según la tarea

  • Agentes de código largos. Claude Opus 5 sigue arriba en las mediciones agénticas y de WebDev Arena. GLM-5.2 Turbo se acerca en Terminal-Bench a una fracción del coste.
  • Volumen alto con presupuesto ajustado. GLM-5.3 por coste por tarea terminada, DeepSeek V4-Pro si puedes programar los trabajos fuera de hora punta.
  • Despliegue dentro de casa. Qwen3.8-27B con Apache 2.0 y la línea Nemotron 3.5 si necesitas contexto de 1M sin salir de tu infraestructura.
  • Dispositivo y edge. LFM2.5-2.6B y Nemotron Nano-30B.
  • Razonamiento puro. Gemini 3.1 Pro sigue siendo la referencia en esa categoría concreta.

Antes de cambiar de modelo, fija dos o tres tareas reales de tu equipo, mídelas contra el que ya usas y cambia solo si la diferencia es clara. La tabla actualizada está en /benchmarks y el catálogo completo de herramientas en /tools.

Profundiza en este tema con IA

Copia un prompt pre-diseñado para continuar tu aprendizaje en tu herramienta favorita.

Ejecutar en tu Asistente

¿Cómo funciona? Al hacer clic en tu plataforma favorita, copiaremos el texto automáticamente y te llevaremos a su página. Solo tienes que pegar el texto (Ctrl+V o Cmd+V) en su chat para comenzar.

Compartir en Redes

Genera una publicación de LinkedIn de menos de 1500 caracteres, en tono natural y citando la fuente.

Dos pasos: primero lanza el prompt en tu asistente para generar el texto. Después abre LinkedIn y pega el resultado en el compositor.