Benchmarks agosto 2026: Claude Opus 5 lidera y Qwen3.8-Max aprieta
ia4·pro Team
Autor Especialista
Artificial Analysis cambió de versión el 6 de agosto
El índice de referencia que usa medio sector pasó a v4.1.1. No es un cambio de metodología, es un parche: actualiza los modelos que hacen de evaluadores en las pruebas con juez automático e incorpora la última versión de τ³-Banking.
El efecto práctico es real: cuando cambia el modelo evaluador, las puntuaciones de todos los modelos se mueven un poco. Si tienes cifras apuntadas de julio, no las compares directamente con las de esta semana.
Claude Opus 5 sigue en cabeza
Claude Opus 5, publicado el 24 de julio, mantiene el primer puesto con un índice de 63. Por debajo aparecen Claude Fable 5 y GPT-5.6 Sol, con la carrera bastante apretada en la parte alta.
Los números concretos de Opus 5 en programación son los más fuertes que se han publicado: 96,0% en SWE-bench Verified y 79,2% en SWE-bench Pro. En pruebas de razonamiento nuevo baja bastante, con 30,2% en ARC-AGI-3 y 43,3% en Frontier-Bench. Contexto de 1 millón de tokens, salida de 128.000, y precio de 5 y 25 dólares por millón de tokens.
Qwen3.8-Max es el que más se acerca por precio
Alibaba publicó Qwen3.8-Max el 3 de agosto y las cifras verificadas lo colocan cerca de la frontera. 86,6 en Terminal-Bench 2.1 frente al 74,5 de la generación anterior, y 67,7 en SWE-bench Pro.
El precio es 2 dólares de entrada y 6 de salida, contra 5 y 25 de Opus 5. Para trabajo agéntico de volumen, la diferencia de factura supera el 70% con una pérdida de unos 11 puntos en SWE-bench Pro. Esta semana además salen los pesos, así que la ecuación cambia otra vez.
Los modelos abiertos van cerrando distancia
Meta publicó Muse Spark 1.2 el 5 de agosto junto a Muse Code, su primer agente de terminal. Artificial Analysis le da un índice de 54 en su ajuste de razonamiento más alto, subiendo desde 51 en la 1.1 y 43 en la versión de abril. Tres saltos en cuatro meses.
DeepSeek V4-Flash-0731 marca 50 de índice, con 82,7 en Terminal-Bench 2.1 y un Elo de 1559 en GDPval-AA. MiniMax M3 aparece en el puesto 18 de 216 en el ranking público de BenchLM con 68,78 sobre 100 y 1 millón de tokens de contexto. Y Nemotron 3 Nano Omni de NVIDIA llega a 323 tokens por segundo con solo 3.000 millones de parámetros activos.
La tabla de agosto
| Modelo | Índice | SWE-bench Pro | Terminal-Bench 2.1 | Contexto | Pesos |
|---|---|---|---|---|---|
| Claude Opus 5 | 63 | 79,2% | — | 1M | Cerrado |
| Qwen3.8-Max | — | 67,7 | 86,6 | 1M | Abiertos (ago) |
| Muse Spark 1.2 | 54 | — | — | — | Cerrado |
| DeepSeek V4-Flash | 50 | — | 82,7 | 1M | Abiertos |
| Muse Glimmer 30B | — | 51,2% | 60,7 | — | Apache 2.0 |
| GLM-5.2 | 51 | 62,1 | 81,0 | 1M | Abiertos |
Lo que cuesta cada uno
| Modelo | Entrada por millón | Salida por millón |
|---|---|---|
| Claude Opus 5 | 5 $ | 25 $ |
| Qwen3.8-Max | 2 $ | 6 $ |
| Gemini 3.1 Pro | 2 $ | 12 $ |
| Grok 4.5 | 2 $ | 6 $ |
| Muse Glimmer 30B | 0 $ (local) | 0 $ (local) |
Correr un modelo abierto también cuesta: GPU, electricidad y tiempo de configuración. El punto de equilibrio suele estar entre 150 y 300 dólares mensuales de API, según el hardware que ya tengas.
Cómo leer estas cifras sin equivocarte
Avisos que se repiten cada mes en la página de benchmarks:
- Las cifras del fabricante en el día del lanzamiento casi siempre bajan cuando llega la verificación independiente. Kimi K3 es el ejemplo reciente.
- Un índice compuesto esconde el detalle que te importa. Un modelo con índice 54 puede ganarle a uno de 63 en tu tarea concreta.
- El benchmark que mide tu trabajo real casi nunca existe. Monta 20 casos de tu día a día y pásalos por los dos candidatos antes de decidir.
Qué elegir según la tarea
- Código difícil de una sola pasada: Claude Opus 5, por el 79,2% en SWE-bench Pro.
- Agentes de terminal con volumen alto: Qwen3.8-Max, por los 86,6 puntos a un tercio del precio.
- Trabajo repetitivo y datos que no salen de casa: Muse Glimmer en local.
- Contexto muy largo: Gemini 3.5 Flash con 2 millones de tokens sigue siendo el techo práctico.
- Presupuesto ajustado sin renunciar a agentes: DeepSeek V4-Flash, con 82,7 en Terminal-Bench y pesos abiertos.
Ninguna de estas elecciones aguanta más de un trimestre. Vuelve a medir en octubre.
Profundiza en este tema con IA
Copia un prompt pre-diseñado para continuar tu aprendizaje en tu herramienta favorita.
Ejecutar en tu Asistente
Compartir en Redes
Genera una publicación de LinkedIn de menos de 1500 caracteres, en tono natural y citando la fuente.
Lleva la teoría a la práctica
Aplica lo que lees con cursos 100% gratuitos y orientados a resultados reales.