Blog metamodelos-abiertosagenteslocalherramientas

Muse Glimmer: el agente de Meta que corre en tu propia GPU

i

ia4·pro Team

Autor Especialista

Publicado el
Compartir

Qué publicó Meta el 10 de agosto

Muse Glimmer es un modelo de 30.000 millones de parámetros con pesos abiertos bajo licencia Apache 2.0, disponible en Hugging Face, Ollama y los binarios habituales de llama.cpp y vLLM. Meta lo destiló del modelo cerrado Muse Spark usando destilación de logits, y el resultado conserva buena parte de su comportamiento agéntico.

Con cuantización de 4 bits ocupa menos de 20 GB, frente a los más de 55 GB en precisión completa. Cabe en una tarjeta de 24 GB de VRAM y sobra sitio en una de 32 GB.

Los benchmarks donde manda y donde no

Meta lo presenta como el modelo más capaz de los que caben en una máquina de escritorio. Las cifras publicadas lo sitúan por delante en tareas de terminal y por detrás en control de escritorio.

Benchmark Muse Glimmer 30B Referencia
Terminal-Bench 2.1 60,7 Lidera entre modelos locales
SWE-Bench Verified 77,2 Por delante de su categoría
SWE-Bench Pro 51,2% Lejos del 79,2% de Claude Opus 5
MCP Atlas 75,5 Lidera entre modelos locales
AIME 2026 94,7% Matemáticas de competición
OSWorld-Verified 65,9 Qwen3.6-27B saca 75,6

El punto flojo está en OSWorld-Verified, la prueba de manejo de escritorio real. Ahí Qwen3.6-27B sigue por delante con casi 10 puntos de margen. Si tu caso de uso es automatizar clics en aplicaciones de ventana, el modelo de Alibaba encaja mejor.

Cuánta VRAM necesitas de verdad

Meta publicó dos cuantizaciones oficiales con la pérdida de calidad medida, cosa que agradece cualquiera que haya perseguido un GGUF a ciegas.

Cuantización VRAM objetivo Degradación media
K-Quant-Dynamic 32 GB 0,2%
K-Quant-17GB 24 GB 1,0%

Con 32 GB la pérdida es despreciable. Con 24 GB pagas un 1% de calidad, que en tareas de código se nota poco y en razonamiento matemático algo más.

La velocidad con DFlash cambia el cálculo

En modo agente una sola tarea encadena decenas de llamadas al modelo, así que 25 tokens por segundo se quedan cortos enseguida. Muse Glimmer incluye DFlash, decodificación especulativa que multiplica el rendimiento.

Hardware Sin DFlash Con DFlash Mejora
RTX 5090 74,9 tok/s 233,4 tok/s 3,1×
Apple M5 Max 26,6 tok/s 50,2 tok/s 1,9×
Apple M4 Max 23,7 tok/s 37,8 tok/s 1,6×

Con 233 tokens por segundo en una 5090 estás en territorio de API de pago. En un M4 Max los 37,8 tok/s dan para trabajar, aunque las tareas largas de varios pasos se hacen notar.

Qué permite la licencia Apache 2.0

Uso comercial, uso privado, modificación y redistribución, sin coste de licencia ni cláusula de usuarios activos mensuales. Es distinta de lo que Meta venía haciendo con Llama, que arrastraba una licencia propia con límites de escala.

Para una consultora o un despacho, esto significa que puedes desplegar el modelo en tu propio servidor, procesar documentos de clientes sin que salgan de tu red y facturar el servicio sin pedir permiso a nadie. Los datos regulados dejan de ser el argumento que bloquea el proyecto.

Dónde encaja y dónde no

Encaja bien en trabajo repetitivo de código, organización de archivos, extracción de datos de documentos, y cualquier flujo donde el volumen haría cara la API. También en entornos sin conexión o con requisitos de confidencialidad estrictos.

No encaja para los problemas más duros de programación, donde 51,2% en SWE-Bench Pro se queda a 28 puntos de la frontera cerrada. Tampoco para tareas que necesiten un contexto enorme o conocimiento muy actualizado del mundo.

Cómo empezar hoy

  1. Comprueba tu VRAM. Con 24 GB usa K-Quant-17GB, con 32 GB o más usa K-Quant-Dynamic.
  2. Instala Ollama y descarga el modelo, o compila llama.cpp si quieres control fino sobre la cuantización.
  3. Activa DFlash desde el primer momento. Sin él la experiencia agéntica se hace pesada.
  4. Conéctalo a tus herramientas por MCP. El 75,5 en MCP Atlas indica que sostiene bien flujos encadenados.
  5. Mide una semana de trabajo real antes de decidir. Compara latencia y calidad contra lo que uses hoy en la nube.

Para quién tiene sentido

Si gastas más de 200 dólares al mes en API para tareas de agente repetitivas, el cálculo sale a favor de probarlo. Si trabajas con datos que no pueden salir de tu infraestructura, deja de ser una opción y pasa a ser la vía práctica. Para el resto, sigue teniendo sentido pagar por un modelo de frontera y dejar la GPU para otra cosa. Puedes contrastar las alternativas en nuestro catálogo de herramientas y en la comparativa de agentes.

Profundiza en este tema con IA

Copia un prompt pre-diseñado para continuar tu aprendizaje en tu herramienta favorita.

Ejecutar en tu Asistente

¿Cómo funciona? Al hacer clic en tu plataforma favorita, copiaremos el texto automáticamente y te llevaremos a su página. Solo tienes que pegar el texto (Ctrl+V o Cmd+V) en su chat para comenzar.

Compartir en Redes

Genera una publicación de LinkedIn de menos de 1500 caracteres, en tono natural y citando la fuente.

Dos pasos: primero lanza el prompt en tu asistente para generar el texto. Después abre LinkedIn y pega el resultado en el compositor.