Blog resumen semanalGrok 4.6Gemini 3.7 FlashGLM-5.3Qwen3.8-27B

Resumen IA: Grok 4.6, Gemini 3.7 Flash y GLM-5.3 en tres días

i

ia4·pro Team

Autor Especialista

Publicado el
Compartir

Tres días, cuatro modelos de gama alta

Del 12 al 14 de agosto de 2026 salieron cuatro modelos que compiten por el mismo trabajo: programación larga y agentes que sostienen varias horas de tarea. xAI abrió con Grok 4.6 el día 12, Google publicó Gemini 3.7 Flash el 13 y el 14 llegaron a la vez GLM-5.3 de Z.ai y Qwen3.8-27B de Alibaba.

Modelo Empresa Fecha Contexto Precio por millón de tokens
Grok 4.6 xAI 12 ago 500.000 2$ entrada / 6$ salida
Gemini 3.7 Flash Google 13 ago 1.048.576 0,75$ / 3,75$ hasta el 31 dic
GLM-5.3 Z.ai 14 ago mismo base que GLM-5.2 sin tarifa pública confirmada
Qwen3.8-27B Alibaba 14 ago 262.144 (hasta 1M) pesos abiertos, Apache 2.0

Dos de ellos ni siquiera tienen modelo base nuevo. Grok 4.6 sigue montado sobre la misma base V9 de 1,5 billones de parámetros que Grok 4.5, y Z.ai dice por escrito que GLM-5.3 comparte base con GLM-5.2 y que toda la mejora viene del post-entrenamiento.

Grok 4.6 empata con GPT-5.6 Sol en el índice de Artificial Analysis

Grok 4.6 marca 61 puntos en el Artificial Analysis Intelligence Index, cinco por encima de los 56 de Grok 4.5 y exactamente los mismos que GPT-5.6 Sol Max. Por delante siguen Claude Opus 5 con 63 y Claude Fable 5 con 62.

Donde más sube es en tareas de agente largo. DeepSWE v1.1 pasa de 54% a 65,9%, APEX-Agents de 47,1% a 57,5% y Terminal-Bench v3.0 de 15,7% a 26%. Ese último número sigue siendo bajo comparado con el 34,6% de GPT-5.6 Sol, así que xAI recorta distancia sin adelantar.

El contexto se queda en 500.000 tokens y el precio en 2$ de entrada y 6$ de salida por millón, con la entrada cacheada a 0,50$. A partir de 200.000 tokens de prompt todo se dobla. Los detalles completos están en nuestro análisis de benchmarks de esta semana.

Gemini 3.7 Flash cobra la mitad que la versión anterior

Google presentó Gemini 3.7 Flash menos de un mes después de 3.6 Flash y le puso un precio de 0,75$ de entrada y 3,75$ de salida por millón. Eso es la mitad de lo que costaba 3.6 Flash, con una condición: la tarifa caduca el 31 de diciembre de 2026 y después sube a 1,50$ y 7,50$.

En DeepSWE v1.1 sube de 49,0% a 65,3% y en FrontierCode de 34,4% a 43,6%. Mantiene la ventana de 1.048.576 tokens y un límite de salida de 64K.

GLM-5.3 y Qwen3.8-27B mueven la línea de los pesos abiertos

Z.ai reporta 84,5% en CyberGym y una subida de Terminal-Bench 3.0 de 4,6 a 28,3 puntos, además de DeepSWE v1.1 de 46,2 a 66,9. Todos esos números son de la propia Z.ai y ningún laboratorio independiente los ha vuelto a medir con un arnés común. Los pesos llegarán alrededor de dos semanas después del lanzamiento, es decir a finales de agosto, cuando termine su evaluación de seguridad.

Qwen3.8-27B sí salió con licencia Apache 2.0 desde el primer día. Es un modelo denso de 27.000 millones de parámetros, con visión nativa, 262.144 tokens de contexto ampliables a un millón y 52 puntos de índice en Artificial Analysis. Contra Claude Opus 4.6 Max marca 89,2% en GPQA Diamond, 90,3% en LiveCodeBench v6 y 84,3% en OSWorld-Verified.

Claude Code pasa el modo automático a por defecto

Desde el 14 de agosto, las sesiones nuevas de Claude Code en los planes Pro, Max y Team arrancan con el modo automático activado. Un clasificador decide qué acciones se ejecutan sin preguntar y cuáles se bloquean, en lugar de la lista de permisos manual.

En la misma semana Anthropic añadió al escritorio una casilla de auto-continuar que retoma una sesión parada en cuanto se reinicia la ventana de límite de uso. Y publicó Claude for Government en beta, con Anthropic como parte contratante directa, sin necesidad de un proveedor cloud intermedio.

Microsoft renombra Copilot y actualiza su ficha de aplicación

El 18 de agosto Microsoft actualizó la ficha de aplicación de Copilot. Microsoft 365 Copilot pasa a llamarse Microsoft Copilot, y el documento confirma qué modelos hay dentro: GPT de Azure OpenAI, GPT de OpenAI y Claude Opus y Claude Sonnet de Anthropic. Anthropic y OpenAI figuran como subprocesadores. Lo desglosamos en la ficha de Copilot.

Qué vigilar los próximos días

  • Los pesos de GLM-5.3, prometidos para finales de agosto.
  • Si algún laboratorio independiente reproduce el 84,5% de CyberGym.
  • El 31 de diciembre de 2026, cuando Gemini 3.7 Flash dobla su precio.
  • La lista completa de modelos y precios está actualizada en /benchmarks y las herramientas en /tools.

Profundiza en este tema con IA

Copia un prompt pre-diseñado para continuar tu aprendizaje en tu herramienta favorita.

Ejecutar en tu Asistente

¿Cómo funciona? Al hacer clic en tu plataforma favorita, copiaremos el texto automáticamente y te llevaremos a su página. Solo tienes que pegar el texto (Ctrl+V o Cmd+V) en su chat para comenzar.

Compartir en Redes

Genera una publicación de LinkedIn de menos de 1500 caracteres, en tono natural y citando la fuente.

Dos pasos: primero lanza el prompt en tu asistente para generar el texto. Después abre LinkedIn y pega el resultado en el compositor.