DeepSeek V4-Pro y GLM-5.2 Turbo: los benchmarks de agosto 2026
ia4·pro Team
Autor Especialista
Doce modelos en veinte días
Agosto de 2026 lleva doce modelos publicados por siete proveedores. El ritmo supera lo que cualquier equipo puede evaluar: para cuando terminas de medir uno ya han salido dos más.
Para elegir pesan el ajuste a la tarea, el coste de cambiar de proveedor y el control que te queda sobre el despliegue. El titular del lanzamiento no dice nada de eso.
DeepSeek V4-Pro llega a disponibilidad general
DeepSeek V4-Pro-0813 salió el 13 de agosto y pasó a disponibilidad general con el cambio de tarifas del día 16. Está accesible por API y en el modo Experto de la app y la web.
Es el modelo con el que DeepSeek compite en programación y en agentes largos, y la referencia de valor en pesos abiertos junto a Kimi K3, que Moonshot publicó en julio con 2,8 billones de parámetros.
El cambio de precios importa tanto como el modelo. La entrada cuesta 0,66$ por millón fuera de hora punta y 1,32$ dentro. La salida, 1,98$ y 3,96$. Lo desglosamos en el análisis de precios de esta semana.
GLM-5.2 Turbo y las cifras de Terminal-Bench
Z.ai publicó GLM-5.2 Turbo el 17 de agosto sobre una base de 743.000 millones de parámetros. Los números que da la empresa son 81,0 en Terminal-Bench 2.1 y 62,1 en SWE-bench Pro.
Tres días antes había salido GLM-5.3, con 60 puntos en el Artificial Analysis Intelligence Index y un precio de 1,40$ de entrada y 4,40$ de salida por millón. Esa combinación le da el coste por tarea terminada más bajo de cualquier modelo de frontera, que es la métrica que más pesa cuando ejecutas agentes que encadenan decenas de llamadas.
Qwen3.8-Max: 2,4 billones de parámetros solo por API
Alibaba publicó Qwen3.8-Max el 2 de agosto como su modelo insignia, con 2,4 billones de parámetros y disponible solo por API. La versión abierta llegó el 14 con Qwen3.8-27B, bajo licencia Apache 2.0.
La separación entre un tope cerrado por API y una versión abierta más pequeña se ha convertido en el patrón habitual de Alibaba, Z.ai y DeepSeek. Te dan pesos suficientes para desplegar dentro de casa y reservan el modelo grande para el servicio de pago.
Nemotron 3.5 Lightning y los modelos pequeños
NVIDIA mantiene la línea Nemotron 3.5, que va del Nano-30B al Ultra-550B con 1 millón de tokens de contexto. La encabeza ahora Lightning-30B-A3B, orientado a agentes, con arquitectura de expertos que activa 3.000 millones de parámetros por token.
Liquid AI publicó LFM2.5-2.6B el 4 de agosto para despliegue en dispositivo y agentes ligeros. Es la parte del mercado que menos titulares genera y más se está moviendo: modelos que corren en un portátil o un móvil sin llamar a ninguna API.
La tabla general de agosto
| Modelo | Índice de referencia | Precio entrada / salida | Contexto |
|---|---|---|---|
| GPT-5.6 Sol | 57,2 (LLM Stats) | según plan | 400.000 |
| Claude Opus 5 | 56,5 (LLM Stats), 1691 Elo en WebDev Arena | según plan | 500.000 |
| Claude Fable 5 | 56,3 (LLM Stats) | según plan | 500.000 |
| Grok 4.6 | 61 (Artificial Analysis) | 2$ / 6$ | 500.000 |
| GLM-5.3 | 60 (Artificial Analysis) | 1,40$ / 4,40$ | base GLM-5.2 |
| DeepSeek V4-Pro | referencia en pesos abiertos | 0,66$–1,32$ / 1,98$–3,96$ | según despliegue |
| Qwen3.8-27B | pesos abiertos Apache 2.0 | despliegue propio | 262.144 (hasta 1M) |
Los dos índices no son comparables entre sí: LLM Stats y Artificial Analysis usan baterías distintas y escalas distintas. Compara dentro de cada columna, no entre ellas.
Qué usar según la tarea
- Agentes de código largos. Claude Opus 5 sigue arriba en las mediciones agénticas y de WebDev Arena. GLM-5.2 Turbo se acerca en Terminal-Bench a una fracción del coste.
- Volumen alto con presupuesto ajustado. GLM-5.3 por coste por tarea terminada, DeepSeek V4-Pro si puedes programar los trabajos fuera de hora punta.
- Despliegue dentro de casa. Qwen3.8-27B con Apache 2.0 y la línea Nemotron 3.5 si necesitas contexto de 1M sin salir de tu infraestructura.
- Dispositivo y edge. LFM2.5-2.6B y Nemotron Nano-30B.
- Razonamiento puro. Gemini 3.1 Pro sigue siendo la referencia en esa categoría concreta.
Antes de cambiar de modelo, fija dos o tres tareas reales de tu equipo, mídelas contra el que ya usas y cambia solo si la diferencia es clara. La tabla actualizada está en /benchmarks y el catálogo completo de herramientas en /tools.
Profundiza en este tema con IA
Copia un prompt pre-diseñado para continuar tu aprendizaje en tu herramienta favorita.
Ejecutar en tu Asistente
Compartir en Redes
Genera una publicación de LinkedIn de menos de 1500 caracteres, en tono natural y citando la fuente.
Lleva la teoría a la práctica
Aplica lo que lees con cursos 100% gratuitos y orientados a resultados reales.