Muse Glimmer: el agente de Meta que corre en tu propia GPU
ia4·pro Team
Autor Especialista
Qué publicó Meta el 10 de agosto
Muse Glimmer es un modelo de 30.000 millones de parámetros con pesos abiertos bajo licencia Apache 2.0, disponible en Hugging Face, Ollama y los binarios habituales de llama.cpp y vLLM. Meta lo destiló del modelo cerrado Muse Spark usando destilación de logits, y el resultado conserva buena parte de su comportamiento agéntico.
Con cuantización de 4 bits ocupa menos de 20 GB, frente a los más de 55 GB en precisión completa. Cabe en una tarjeta de 24 GB de VRAM y sobra sitio en una de 32 GB.
Los benchmarks donde manda y donde no
Meta lo presenta como el modelo más capaz de los que caben en una máquina de escritorio. Las cifras publicadas lo sitúan por delante en tareas de terminal y por detrás en control de escritorio.
| Benchmark | Muse Glimmer 30B | Referencia |
|---|---|---|
| Terminal-Bench 2.1 | 60,7 | Lidera entre modelos locales |
| SWE-Bench Verified | 77,2 | Por delante de su categoría |
| SWE-Bench Pro | 51,2% | Lejos del 79,2% de Claude Opus 5 |
| MCP Atlas | 75,5 | Lidera entre modelos locales |
| AIME 2026 | 94,7% | Matemáticas de competición |
| OSWorld-Verified | 65,9 | Qwen3.6-27B saca 75,6 |
El punto flojo está en OSWorld-Verified, la prueba de manejo de escritorio real. Ahí Qwen3.6-27B sigue por delante con casi 10 puntos de margen. Si tu caso de uso es automatizar clics en aplicaciones de ventana, el modelo de Alibaba encaja mejor.
Cuánta VRAM necesitas de verdad
Meta publicó dos cuantizaciones oficiales con la pérdida de calidad medida, cosa que agradece cualquiera que haya perseguido un GGUF a ciegas.
| Cuantización | VRAM objetivo | Degradación media |
|---|---|---|
| K-Quant-Dynamic | 32 GB | 0,2% |
| K-Quant-17GB | 24 GB | 1,0% |
Con 32 GB la pérdida es despreciable. Con 24 GB pagas un 1% de calidad, que en tareas de código se nota poco y en razonamiento matemático algo más.
La velocidad con DFlash cambia el cálculo
En modo agente una sola tarea encadena decenas de llamadas al modelo, así que 25 tokens por segundo se quedan cortos enseguida. Muse Glimmer incluye DFlash, decodificación especulativa que multiplica el rendimiento.
| Hardware | Sin DFlash | Con DFlash | Mejora |
|---|---|---|---|
| RTX 5090 | 74,9 tok/s | 233,4 tok/s | 3,1× |
| Apple M5 Max | 26,6 tok/s | 50,2 tok/s | 1,9× |
| Apple M4 Max | 23,7 tok/s | 37,8 tok/s | 1,6× |
Con 233 tokens por segundo en una 5090 estás en territorio de API de pago. En un M4 Max los 37,8 tok/s dan para trabajar, aunque las tareas largas de varios pasos se hacen notar.
Qué permite la licencia Apache 2.0
Uso comercial, uso privado, modificación y redistribución, sin coste de licencia ni cláusula de usuarios activos mensuales. Es distinta de lo que Meta venía haciendo con Llama, que arrastraba una licencia propia con límites de escala.
Para una consultora o un despacho, esto significa que puedes desplegar el modelo en tu propio servidor, procesar documentos de clientes sin que salgan de tu red y facturar el servicio sin pedir permiso a nadie. Los datos regulados dejan de ser el argumento que bloquea el proyecto.
Dónde encaja y dónde no
Encaja bien en trabajo repetitivo de código, organización de archivos, extracción de datos de documentos, y cualquier flujo donde el volumen haría cara la API. También en entornos sin conexión o con requisitos de confidencialidad estrictos.
No encaja para los problemas más duros de programación, donde 51,2% en SWE-Bench Pro se queda a 28 puntos de la frontera cerrada. Tampoco para tareas que necesiten un contexto enorme o conocimiento muy actualizado del mundo.
Cómo empezar hoy
- Comprueba tu VRAM. Con 24 GB usa K-Quant-17GB, con 32 GB o más usa K-Quant-Dynamic.
- Instala Ollama y descarga el modelo, o compila llama.cpp si quieres control fino sobre la cuantización.
- Activa DFlash desde el primer momento. Sin él la experiencia agéntica se hace pesada.
- Conéctalo a tus herramientas por MCP. El 75,5 en MCP Atlas indica que sostiene bien flujos encadenados.
- Mide una semana de trabajo real antes de decidir. Compara latencia y calidad contra lo que uses hoy en la nube.
Para quién tiene sentido
Si gastas más de 200 dólares al mes en API para tareas de agente repetitivas, el cálculo sale a favor de probarlo. Si trabajas con datos que no pueden salir de tu infraestructura, deja de ser una opción y pasa a ser la vía práctica. Para el resto, sigue teniendo sentido pagar por un modelo de frontera y dejar la GPU para otra cosa. Puedes contrastar las alternativas en nuestro catálogo de herramientas y en la comparativa de agentes.
Profundiza en este tema con IA
Copia un prompt pre-diseñado para continuar tu aprendizaje en tu herramienta favorita.
Ejecutar en tu Asistente
Compartir en Redes
Genera una publicación de LinkedIn de menos de 1500 caracteres, en tono natural y citando la fuente.
Lleva la teoría a la práctica
Aplica lo que lees con cursos 100% gratuitos y orientados a resultados reales.