Resumen IA: Grok 4.6, Gemini 3.7 Flash y GLM-5.3 en tres días
ia4·pro Team
Autor Especialista
Tres días, cuatro modelos de gama alta
Del 12 al 14 de agosto de 2026 salieron cuatro modelos que compiten por el mismo trabajo: programación larga y agentes que sostienen varias horas de tarea. xAI abrió con Grok 4.6 el día 12, Google publicó Gemini 3.7 Flash el 13 y el 14 llegaron a la vez GLM-5.3 de Z.ai y Qwen3.8-27B de Alibaba.
| Modelo | Empresa | Fecha | Contexto | Precio por millón de tokens |
|---|---|---|---|---|
| Grok 4.6 | xAI | 12 ago | 500.000 | 2$ entrada / 6$ salida |
| Gemini 3.7 Flash | 13 ago | 1.048.576 | 0,75$ / 3,75$ hasta el 31 dic | |
| GLM-5.3 | Z.ai | 14 ago | mismo base que GLM-5.2 | sin tarifa pública confirmada |
| Qwen3.8-27B | Alibaba | 14 ago | 262.144 (hasta 1M) | pesos abiertos, Apache 2.0 |
Dos de ellos ni siquiera tienen modelo base nuevo. Grok 4.6 sigue montado sobre la misma base V9 de 1,5 billones de parámetros que Grok 4.5, y Z.ai dice por escrito que GLM-5.3 comparte base con GLM-5.2 y que toda la mejora viene del post-entrenamiento.
Grok 4.6 empata con GPT-5.6 Sol en el índice de Artificial Analysis
Grok 4.6 marca 61 puntos en el Artificial Analysis Intelligence Index, cinco por encima de los 56 de Grok 4.5 y exactamente los mismos que GPT-5.6 Sol Max. Por delante siguen Claude Opus 5 con 63 y Claude Fable 5 con 62.
Donde más sube es en tareas de agente largo. DeepSWE v1.1 pasa de 54% a 65,9%, APEX-Agents de 47,1% a 57,5% y Terminal-Bench v3.0 de 15,7% a 26%. Ese último número sigue siendo bajo comparado con el 34,6% de GPT-5.6 Sol, así que xAI recorta distancia sin adelantar.
El contexto se queda en 500.000 tokens y el precio en 2$ de entrada y 6$ de salida por millón, con la entrada cacheada a 0,50$. A partir de 200.000 tokens de prompt todo se dobla. Los detalles completos están en nuestro análisis de benchmarks de esta semana.
Gemini 3.7 Flash cobra la mitad que la versión anterior
Google presentó Gemini 3.7 Flash menos de un mes después de 3.6 Flash y le puso un precio de 0,75$ de entrada y 3,75$ de salida por millón. Eso es la mitad de lo que costaba 3.6 Flash, con una condición: la tarifa caduca el 31 de diciembre de 2026 y después sube a 1,50$ y 7,50$.
En DeepSWE v1.1 sube de 49,0% a 65,3% y en FrontierCode de 34,4% a 43,6%. Mantiene la ventana de 1.048.576 tokens y un límite de salida de 64K.
GLM-5.3 y Qwen3.8-27B mueven la línea de los pesos abiertos
Z.ai reporta 84,5% en CyberGym y una subida de Terminal-Bench 3.0 de 4,6 a 28,3 puntos, además de DeepSWE v1.1 de 46,2 a 66,9. Todos esos números son de la propia Z.ai y ningún laboratorio independiente los ha vuelto a medir con un arnés común. Los pesos llegarán alrededor de dos semanas después del lanzamiento, es decir a finales de agosto, cuando termine su evaluación de seguridad.
Qwen3.8-27B sí salió con licencia Apache 2.0 desde el primer día. Es un modelo denso de 27.000 millones de parámetros, con visión nativa, 262.144 tokens de contexto ampliables a un millón y 52 puntos de índice en Artificial Analysis. Contra Claude Opus 4.6 Max marca 89,2% en GPQA Diamond, 90,3% en LiveCodeBench v6 y 84,3% en OSWorld-Verified.
Claude Code pasa el modo automático a por defecto
Desde el 14 de agosto, las sesiones nuevas de Claude Code en los planes Pro, Max y Team arrancan con el modo automático activado. Un clasificador decide qué acciones se ejecutan sin preguntar y cuáles se bloquean, en lugar de la lista de permisos manual.
En la misma semana Anthropic añadió al escritorio una casilla de auto-continuar que retoma una sesión parada en cuanto se reinicia la ventana de límite de uso. Y publicó Claude for Government en beta, con Anthropic como parte contratante directa, sin necesidad de un proveedor cloud intermedio.
Microsoft renombra Copilot y actualiza su ficha de aplicación
El 18 de agosto Microsoft actualizó la ficha de aplicación de Copilot. Microsoft 365 Copilot pasa a llamarse Microsoft Copilot, y el documento confirma qué modelos hay dentro: GPT de Azure OpenAI, GPT de OpenAI y Claude Opus y Claude Sonnet de Anthropic. Anthropic y OpenAI figuran como subprocesadores. Lo desglosamos en la ficha de Copilot.
Qué vigilar los próximos días
- Los pesos de GLM-5.3, prometidos para finales de agosto.
- Si algún laboratorio independiente reproduce el 84,5% de CyberGym.
- El 31 de diciembre de 2026, cuando Gemini 3.7 Flash dobla su precio.
- La lista completa de modelos y precios está actualizada en /benchmarks y las herramientas en /tools.
Profundiza en este tema con IA
Copia un prompt pre-diseñado para continuar tu aprendizaje en tu herramienta favorita.
Ejecutar en tu Asistente
Compartir en Redes
Genera una publicación de LinkedIn de menos de 1500 caracteres, en tono natural y citando la fuente.
Lleva la teoría a la práctica
Aplica lo que lees con cursos 100% gratuitos y orientados a resultados reales.