Blog benchmarksmodelosclaudeqwencomparativa

Benchmarks agosto 2026: Claude Opus 5 lidera y Qwen3.8-Max aprieta

i

ia4·pro Team

Autor Especialista

Publicado el
Compartir

Artificial Analysis cambió de versión el 6 de agosto

El índice de referencia que usa medio sector pasó a v4.1.1. No es un cambio de metodología, es un parche: actualiza los modelos que hacen de evaluadores en las pruebas con juez automático e incorpora la última versión de τ³-Banking.

El efecto práctico es real: cuando cambia el modelo evaluador, las puntuaciones de todos los modelos se mueven un poco. Si tienes cifras apuntadas de julio, no las compares directamente con las de esta semana.

Claude Opus 5 sigue en cabeza

Claude Opus 5, publicado el 24 de julio, mantiene el primer puesto con un índice de 63. Por debajo aparecen Claude Fable 5 y GPT-5.6 Sol, con la carrera bastante apretada en la parte alta.

Los números concretos de Opus 5 en programación son los más fuertes que se han publicado: 96,0% en SWE-bench Verified y 79,2% en SWE-bench Pro. En pruebas de razonamiento nuevo baja bastante, con 30,2% en ARC-AGI-3 y 43,3% en Frontier-Bench. Contexto de 1 millón de tokens, salida de 128.000, y precio de 5 y 25 dólares por millón de tokens.

Qwen3.8-Max es el que más se acerca por precio

Alibaba publicó Qwen3.8-Max el 3 de agosto y las cifras verificadas lo colocan cerca de la frontera. 86,6 en Terminal-Bench 2.1 frente al 74,5 de la generación anterior, y 67,7 en SWE-bench Pro.

El precio es 2 dólares de entrada y 6 de salida, contra 5 y 25 de Opus 5. Para trabajo agéntico de volumen, la diferencia de factura supera el 70% con una pérdida de unos 11 puntos en SWE-bench Pro. Esta semana además salen los pesos, así que la ecuación cambia otra vez.

Los modelos abiertos van cerrando distancia

Meta publicó Muse Spark 1.2 el 5 de agosto junto a Muse Code, su primer agente de terminal. Artificial Analysis le da un índice de 54 en su ajuste de razonamiento más alto, subiendo desde 51 en la 1.1 y 43 en la versión de abril. Tres saltos en cuatro meses.

DeepSeek V4-Flash-0731 marca 50 de índice, con 82,7 en Terminal-Bench 2.1 y un Elo de 1559 en GDPval-AA. MiniMax M3 aparece en el puesto 18 de 216 en el ranking público de BenchLM con 68,78 sobre 100 y 1 millón de tokens de contexto. Y Nemotron 3 Nano Omni de NVIDIA llega a 323 tokens por segundo con solo 3.000 millones de parámetros activos.

La tabla de agosto

Modelo Índice SWE-bench Pro Terminal-Bench 2.1 Contexto Pesos
Claude Opus 5 63 79,2% 1M Cerrado
Qwen3.8-Max 67,7 86,6 1M Abiertos (ago)
Muse Spark 1.2 54 Cerrado
DeepSeek V4-Flash 50 82,7 1M Abiertos
Muse Glimmer 30B 51,2% 60,7 Apache 2.0
GLM-5.2 51 62,1 81,0 1M Abiertos

Lo que cuesta cada uno

Modelo Entrada por millón Salida por millón
Claude Opus 5 5 $ 25 $
Qwen3.8-Max 2 $ 6 $
Gemini 3.1 Pro 2 $ 12 $
Grok 4.5 2 $ 6 $
Muse Glimmer 30B 0 $ (local) 0 $ (local)

Correr un modelo abierto también cuesta: GPU, electricidad y tiempo de configuración. El punto de equilibrio suele estar entre 150 y 300 dólares mensuales de API, según el hardware que ya tengas.

Cómo leer estas cifras sin equivocarte

Avisos que se repiten cada mes en la página de benchmarks:

  • Las cifras del fabricante en el día del lanzamiento casi siempre bajan cuando llega la verificación independiente. Kimi K3 es el ejemplo reciente.
  • Un índice compuesto esconde el detalle que te importa. Un modelo con índice 54 puede ganarle a uno de 63 en tu tarea concreta.
  • El benchmark que mide tu trabajo real casi nunca existe. Monta 20 casos de tu día a día y pásalos por los dos candidatos antes de decidir.

Qué elegir según la tarea

  • Código difícil de una sola pasada: Claude Opus 5, por el 79,2% en SWE-bench Pro.
  • Agentes de terminal con volumen alto: Qwen3.8-Max, por los 86,6 puntos a un tercio del precio.
  • Trabajo repetitivo y datos que no salen de casa: Muse Glimmer en local.
  • Contexto muy largo: Gemini 3.5 Flash con 2 millones de tokens sigue siendo el techo práctico.
  • Presupuesto ajustado sin renunciar a agentes: DeepSeek V4-Flash, con 82,7 en Terminal-Bench y pesos abiertos.

Ninguna de estas elecciones aguanta más de un trimestre. Vuelve a medir en octubre.

Profundiza en este tema con IA

Copia un prompt pre-diseñado para continuar tu aprendizaje en tu herramienta favorita.

Ejecutar en tu Asistente

¿Cómo funciona? Al hacer clic en tu plataforma favorita, copiaremos el texto automáticamente y te llevaremos a su página. Solo tienes que pegar el texto (Ctrl+V o Cmd+V) en su chat para comenzar.

Compartir en Redes

Genera una publicación de LinkedIn de menos de 1500 caracteres, en tono natural y citando la fuente.

Dos pasos: primero lanza el prompt en tu asistente para generar el texto. Después abre LinkedIn y pega el resultado en el compositor.