Mistral Small 4: un modelo MoE de 119B para reemplazar a cuatro
El último lanzamiento open-source de Mistral AI consolida seguimiento de instrucciones, razonamiento, multimodalidad y coding agéntico en un único modelo Mixture-of-Experts de 119B parámetros bajo licencia Apache 2.0.
Mistral AI lanzó hoy Mistral Small 4 — un modelo Mixture-of-Experts de 119B parámetros que consolida lo que antes eran cuatro productos separados en uno solo. Reemplaza a Mistral Small, Magistral, Pixtral y Devstral. Un modelo, un despliegue, un endpoint de API.
La arquitectura utiliza 128 expertos con 6B parámetros activos por token. Ese es el tradeoff fundamental de MoE: 119B parámetros totales implican una fuerte capacidad de razonamiento, pero solo se paga computación por 6B en cada paso forward. La ventana de contexto es de 256k tokens. Mistral afirma un 40% menos de latencia y 3x más throughput en comparación con Mistral Small 3 — números que, si se mantienen en producción, convierten a este modelo en una opción seria para cualquiera que actualmente gestione múltiples endpoints especializados.
La jugada de consolidación es deliberada. Mistral ha estado fragmentando su catálogo de modelos durante dos años, lanzando variantes específicas para competir en categorías concretas de benchmarks. Esa estrategia funciona para titulares pero genera fricción operativa real: diferentes parámetros de API, diferentes rutas de fine-tuning, diferentes perfiles de latencia. Mistral Small 4 es una apuesta a que un único generalista capaz es más valioso para los desarrolladores que un portafolio de especialistas.
Una funcionalidad genuinamente útil es el parámetro reasoning_effort. Se puede ajustar la inferencia de none a high en tiempo de petición, permitiendo intercambiar latencia por calidad según la tarea. Una llamada de clasificación usa none. Una revisión de código compleja usa high. Este tipo de razonamiento controlable ha sido estándar en la serie o de OpenAI pero es nuevo para Mistral. Es un reconocimiento práctico de que no todas las llamadas necesitan cadena de pensamiento.
El lanzamiento es bajo Apache 2.0 — uso comercial completo, sin restricciones. Está disponible en la API de Mistral, Hugging Face, contenedores NVIDIA NIM day-0, vLLM y llama.cpp. El soporte day-0 de NVIDIA NIM es destacable: significa que se puede ejecutar Mistral Small 4 en contenedores optimizados sobre H100s sin esperar empaquetado de terceros.
Los lanzamientos open-source de Mistral han rendido consistentemente por encima de lo esperado en benchmarks en relación a su tamaño, y la licencia Apache de la compañía la ha convertido en la opción por defecto para empresas que necesitan autoalojar. Si un modelo MoE de 119B es realmente lo bastante “pequeño” para la mayoría de despliegues autoalojados es la verdadera pregunta — la huella de memoria es significativa incluso con routing MoE. Pero para equipos que corren sobre infraestructura multi-GPU, el argumento de consolidación es convincente.
El timing es preciso. Mientras OpenAI y Google empujan sus modelos cada vez más detrás de muros de API, Mistral redobla su apuesta por la apertura como diferenciación de producto.
Lecturas relacionadas
- Modelos de IA MiniMax M3: el modelo de pesos abiertos con 1 millón de tokens de contexto supera a GPT-5.5 en programación a una fracción del coste
- Modelos de IA Mistral Small 4 Es un Solo Modelo que Hace el Trabajo de Tres — y es Completamente Open Source
- Modelos IA OpenAI pone GPT-5.4 Mini al alcance de todos los usuarios gratuitos