Volver al Blog
Modelos de IA 11 de agosto de 2026 5 min read

Meta Lanza Muse Glimmer, un Modelo Abierto de 30B que Corre en una Sola GPU de Consumo

Meta Superintelligence Labs publicó un modelo Apache 2.0 diseñado para agentes locales permanentes, que cabe en 24GB de VRAM y supera a Gemma4-31B por 21 puntos en benchmarks de orquestación agéntica.

Meta Lanza Muse Glimmer, un Modelo Abierto de 30B que Corre en una Sola GPU de Consumo

Meta Superintelligence Labs lanzó Muse Glimmer el 10 de agosto — un modelo de pesos abiertos de 30,000 millones de parámetros diseñado específicamente para agentes de IA permanentes que corren en una sola GPU de consumo, sin necesidad de conexión a la nube. Es gratuito bajo licencia Apache 2.0, y los pesos ya están disponibles en Hugging Face en formatos BF16, GGUF k-quant y ExecuTorch.

El modelo es un transformer causal denso con un codificador de percepción dedicado de 1,800 millones de parámetros, destilado del modelo frontera cerrado de Meta, Muse Spark. A precisión completa necesita 55GB de memoria, pero la configuración K-Quant-17GB de Meta reduce eso a 24GB de VRAM — una RTX 5090, un Mac Studio, una GPU de estación de trabajo — perdiendo solo 1.0% de precisión. Un modo más conservador, K-Quant-Dynamic, mantiene la degradación en 0.2% con 32GB. El verdadero truco es la decodificación por difusión en bloques DFlash, que predice 16 tokens por pasada en lugar de uno, entregando una aceleración de 3.1x — de 74.9 a 233.4 tokens por segundo en una RTX 5090.

Meta lo comparó contra los dos competidores de pesos abiertos más cercanos en su categoría de tamaño: Gemma4-31B de Google y Qwen3.6-27B de Alibaba. En MCP Atlas, un benchmark de orquestación agéntica de herramientas, Muse Glimmer obtuvo 75.5 frente a 54.2 de Gemma4 — una diferencia de 21 puntos. Sin embargo, no es una victoria total. En OSWorld-Verified, un benchmark de uso de computadora, Qwen3.6-27B lidera con 75.6 frente a 65.9 de Muse Glimmer, y Qwen también gana en TerminalBench 2.1. El modelo está construido para orquestación agéntica y llamadas de función, no para control general de computadora — y los benchmarks confirman esa especialización.

Esta es la apuesta más clara de Meta hasta ahora de que la próxima ola de agentes de IA correrá localmente en lugar de a través de llamadas a una API. Un asistente de código, un agente de navegador o un evaluador basado en modelo que nunca sale de tu máquina evita la latencia, el costo por token y las concesiones de privacidad de enrutar cada acción por un modelo frontera alojado en la nube. La licencia Apache 2.0 significa que las startups pueden ajustar y comercializar el modelo sin ninguna regalía asociada — el mismo manual que convirtió a Llama en el modelo base por defecto para gran parte del ecosistema de IA de código abierto.

El nivel de pesos abiertos entre 27 y 31 mil millones de parámetros ya está genuinamente disputado — Meta, Google y Alibaba presentando entradas con semanas de diferencia entre sí — lo cual es buena noticia para quien construye sobre esa base y mala noticia para los proveedores de API cerradas que venden inferencia a ese nivel de capacidad.

Fuentes

Meta IA de pesos abiertos IA agéntica Apache 2.0