El M2.7 de MiniMax ejecutó más de 100 ciclos autónomos para ayudar a entrenarse a sí mismo
El laboratorio chino MiniMax lanzó M2.7 el 18 de marzo, un modelo que ejecutó de forma autónoma más de 100 bucles iterativos de desarrollo — analizando fallos, reescribiendo su propio código de andamiaje y gestionando entre el 30 y el 50% de su flujo de trabajo de investigación en aprendizaje por refuerzo sin intervención humana.
MiniMax lanzó M2.7 el 18 de marzo con una afirmación que merece una lectura detenida: el modelo ejecutó más de 100 ciclos autónomos de desarrollo durante su propio entrenamiento, gestionando entre el 30 y el 50 por ciento del flujo de trabajo de investigación en aprendizaje por refuerzo sin intervención humana. El bucle funcionaba así: analizar trayectorias de fallo, planificar cambios, reescribir código de andamiaje, ejecutar evaluaciones, comparar resultados y decidir si conservar o revertir — repetido más de cien veces antes de que el modelo final saliera a producción.
No es una abstracción de marketing. Es una afirmación concreta sobre mejora recursiva autónoma en producción, el tipo de avance que los investigadores de IA han teorizado durante años. MiniMax es el primer laboratorio comercial en publicar detalles sobre su despliegue a escala dentro de un pipeline de entrenamiento real.
Los resultados en benchmarks son sólidos, especialmente para un modelo de un laboratorio chino que no cuenta con el reconocimiento de marca de Anthropic u OpenAI en mercados occidentales. M2.7 obtiene un 56,22% en SWE-Pro, igualando a GPT-5.3-Codex. En Terminal-Bench 2.0 alcanza el 57,0%. En GDPval-AA para tareas profesionales de oficina — procesamiento de documentos, trabajo con hojas de cálculo — registra un Elo de 1495, que la compañía afirma es el más alto entre los modelos de acceso abierto.
La arquitectura del agente está diseñada para la profundidad, no para la amplitud. M2.7 viene con más de 40 habilidades complejas, cada una descrita en prompts de más de 2.000 tokens. La tasa de adherencia a las habilidades es del 97%. El modelo soporta búsqueda dinámica de herramientas y coordinación de equipos multiagente. Está diseñado explícitamente para tareas agénticas de largo horizonte, no para generación de un solo turno.
MiniMax ha operado mayormente bajo el radar fuera de China. M2.7 cambia esa postura. Los pipelines de entrenamiento autoevolutivos, si resisten el escrutinio, comprimen significativamente el ciclo de desarrollo — menos investigadores humanos necesarios por iteración de entrenamiento, iteración más rápida sobre el comportamiento del modelo, menor coste por mejora. Eso es una ventaja estructural, no solo una victoria en benchmarks.
La pregunta obvia es la reproducibilidad. Una carga de trabajo de I+D autónoma del 30-50% suena transformadora, pero los detalles de lo que significa “tarea de I+D” en este contexto importan enormemente. Aun así, publicar la metodología invita a la verificación. Si los números se sostienen, M2.7 es un lanzamiento más significativo de lo que sugiere su cobertura mediática occidental.
Lecturas relacionadas
- Modelos IA GPT-5.4 llega con uso nativo de ordenador — los agentes ya pueden controlar escritorios completos
- Modelos de IA Anthropic lanza Claude Fable 5: potencia de clase Mythos con salvaguardas que arrasa en todos los benchmarks de código
- Modelos de IA Gemini 3.5 Pro de Google llega en junio — contexto de 2 millones de tokens y razonamiento Deep Think