El V4-Flash reentrenado de DeepSeek ya supera a su propio modelo insignia en todos los benchmarks de agentes
DeepSeek-V4-Flash-0731 obtiene 82,7 en Terminal Bench 2.1 y 54,4 en DeepSWE, superando al más grande V4-Pro-Preview en los nueve benchmarks de codificación agéntica publicados, usando solo 13.000 millones de parámetros activos.
DeepSeek publicó la versión oficial de DeepSeek-V4-Flash-0731 el 31 de julio, y las cifras invierten lo que se supone que significa “insignia”. La versión reentrenada de Flash ahora supera al propio V4-Pro-Preview, más grande, de DeepSeek en los nueve benchmarks de codificación agéntica que la empresa ha publicado —un modelo más pequeño y más barato venciendo al mayor que debía superarlo.
El salto respecto a la versión preliminar de Flash es contundente. En Terminal Bench 2.1, un benchmark que mide cómo maneja un modelo tareas reales de línea de comandos y agénticas, V4-Flash-0731 obtiene 82,7 frente a 72,1 de V4-Pro-Preview y solo 61,8 de la vista previa original de Flash. DeepSWE, que evalúa la finalización de tareas de ingeniería de software, saltó de 7,3 a 54,4 —una mejora de aproximadamente siete veces en una sola ronda de reentrenamiento. En el Artificial Analysis Intelligence Index, el modelo alcanza 50, situándose al nivel de modelos con varias veces su número de parámetros activos.
Lo llamativo de estas cifras es su origen arquitectónico. V4-Flash-0731 mantiene 284.000 millones de parámetros totales pero activa solo 13.000 millones por token, opera con una ventana de contexto de un millón de tokens y se distribuye bajo licencia MIT —la licencia abierta más permisiva de uso común, sin restricciones de campo de uso ni comerciales. DeepSeek no escaló el modelo para lograr estas mejoras: ejecutó una nueva ronda de post-entrenamiento, la fase que determina cómo despliega un modelo el conocimiento que ya posee, en lugar de añadir parámetros o volumen de datos. Es una forma sustancialmente más económica de cerrar la brecha con modelos más grandes, y un manual repetible que otros laboratorios tendrán ahora que responder.
Contexto: esto llega la misma semana en que LG lanzó un K-EXAONE 2.0 de 750.000 millones de parámetros, y poco más de una semana después del acuerdo de cómputo de Anthropic con AMD y el lanzamiento de Opus 5. Los laboratorios de pesos abiertos ya no van a la zaga de los laboratorios frontera cerrados igualando escala: DeepSeek acaba de demostrar que el post-entrenamiento por sí solo, sobre un MoE de tamaño medio, puede vencer a un modelo de la misma familia con muchísimo más cómputo activo. Para equipos que eligen entre APIs frontera de pago y pesos abiertos autoalojados para cargas de trabajo de codificación agéntica, la relación precio-rendimiento de V4-Flash-0731 con 13B de parámetros activos ya es difícil de ignorar.
Una advertencia que conviene decir con claridad: todas estas cifras de benchmark están reportadas por el propio DeepSeek y aún no han sido verificadas de forma independiente por evaluadores externos. Trata las mejoras relativas como creíbles en dirección, dada la consistencia entre los nueve benchmarks, pero espera la verificación externa antes de apostar infraestructura de producción a las puntuaciones absolutas.
Fuentes
Lecturas relacionadas
- Modelos de IA Moonshot AI lanza Kimi K3, el modelo de pesos abiertos más grande jamás publicado con 2,8 billones de parámetros
- Modelos de IA DeepSeek recauda 7.400 millones a una valoración superior a 50.000 millones y se convierte en la startup de IA más valiosa de China
- Modelos de IA Cuatro modelos de IA chinos de código abierto en 12 días: DeepSeek V4, Kimi K2.6 y el nuevo suelo de precios