ia4·pro
Blog benchmarksDeepSeekMetamodelos abiertosIntelligence Index

DeepSeek V4-Flash, Muse Spark 1.1 e Inkling: benchmarks de agosto

i

ia4·pro Team

Autor Especialista

Publicado el
Compartir

Tres lanzamientos que mueven la tabla

Julio cerró con tres modelos que cambian la referencia de precio por capacidad: DeepSeek-V4-Flash-0731, Meta Muse Spark 1.1 y la familia Inkling de Thinking Machines. Los tres compiten en la franja media de la tabla, que es donde la mayoría de las empresas compra de verdad.

Todas las cifras de esta sección proceden del Intelligence Index de Artificial Analysis y de las evaluaciones de Vals AI, medidos entre el 9 y el 31 de julio de 2026.

DeepSeek V4-Flash-0731 adelanta a su hermano mayor

DeepSeek publicó V4-Flash-0731 el 31 de julio bajo licencia abierta en Hugging Face. Marca 50 puntos en el Intelligence Index, diez más que la versión previa de V4-Flash. La mediana entre modelos abiertos de tamaño similar está en 25.

El salto grande está en tareas de agente. El Elo en GDPval-AA v2, la evaluación centrada en trabajo real, sube de 1189 a 1559. Y en Terminal Bench 2.1 firma 82,7 frente al 72,1 de V4-Pro-Preview, el modelo premium de la propia DeepSeek. Un 14,7% de ventaja del barato sobre el caro.

Eso obliga a revisar cualquier decisión de arquitectura tomada hace un mes. Si estabas pagando el tier Pro por fiabilidad agéntica, la versión Flash actualizada te da más por menos.

Meta Muse Spark 1.1 gana 8 puntos en tres meses

Meta lanzó Muse Spark 1.1 el 9 de julio con 51 puntos de Intelligence Index, ocho más que su versión anterior tres meses atrás. Vals AI le atribuye un 68,41% de precisión en su índice, con un margen de 1,27 puntos.

El argumento de Meta es la eficiencia: rinde a la altura de sus competidores gastando menos tokens y menos coste por tarea. Para volúmenes altos de peticiones sencillas, ese detalle pesa más que dos puntos de índice.

Inkling Small: casi lo mismo con un tercio de los parámetros

Thinking Machines colocó Inkling Small en 40 puntos, a menos de un punto de su modelo insignia Inkling, usando menos de un tercio de los parámetros totales y activos.

Es la confirmación de algo que ya se veía en otras familias: la destilación está funcionando bien y los modelos pequeños se acercan mucho a los grandes en las tareas habituales. Para despliegues en infraestructura propia, esa diferencia de tamaño decide si el modelo cabe o no en las GPU que ya tienes.

La tabla completa de agosto 2026

Modelo Intelligence Index Nota destacada Licencia
Claude Opus 5 61 Agentic Index 55,3, primer puesto general Cerrada, 5/25 USD por 1M
GPT-5.6 Sol Ultra Alto 91,9% en TerminalBench 2.1 Cerrada
Meta Muse Spark 1.1 51 68,41% en índice Vals, buena eficiencia de coste Cerrada
DeepSeek V4-Flash-0731 50 82,7 en Terminal Bench 2.1, Elo 1559 Abierta
Thinking Machines Inkling Small 40 A 1 punto del modelo grande con 1/3 de parámetros Cerrada

Qué señales conviene leer en estos números

El índice general funciona bien como filtro inicial y poco más. Dos modelos separados por un punto pueden comportarse muy distinto en tu caso concreto, sobre todo si tu carga incluye llamadas a herramientas o sesiones largas.

Las evaluaciones agénticas, como GDPval-AA v2 y Terminal Bench, predicen mejor el rendimiento en flujos de trabajo reales que las pruebas de conocimiento. Si tu producto encadena pasos, mira esas primero.

El coste por tarea completada dice más que el precio por millón de tokens. Un modelo que necesita tres intentos a 1 dólar sale más caro que uno que acierta a la primera a 2 dólares.

Cómo aplicarlo esta semana

  • Vuelve a medir tu caso de uso principal contra DeepSeek V4-Flash-0731 antes de renovar contrato con un proveedor cerrado.
  • Si ejecutas modelos en tu propia infraestructura, evalúa Inkling Small como candidato a reemplazar un modelo grande en tareas de rutina.
  • Registra el coste por tarea completada, no el coste por token, en tus cuadros de mando.
  • Repite las mediciones cada mes. Entre el 9 y el 31 de julio se movieron tres posiciones de esta tabla.

Tienes los datos actualizados y comparables en la sección de benchmarks del sitio, y el resto de modelos abiertos en el catálogo de herramientas.

Profundiza en este tema con IA

Copia un prompt pre-diseñado para continuar tu aprendizaje en tu herramienta favorita.

Ejecutar en tu Asistente

💡 ¿Cómo funciona? Al hacer clic en tu plataforma favorita, copiaremos el texto automáticamente y te llevaremos a su página. Solo tienes que pegar el texto (Ctrl+V o Cmd+V) en su chat para comenzar.