Volver al Blog
Productividad del Desarrollador 21 de marzo de 2026 5 min read

Composer 2 de Cursor supera a Claude Opus 4.6 en benchmarks de programación — con un 86% menos de coste

Cursor lanzó Composer 2 el 19 de marzo, un modelo de programación ajustado sobre Kimi K2.5 que supera al buque insignia de Anthropic en CursorBench y SWE-bench Multilingual, reduciendo el coste de tokens de entrada de 3,50 $ a 0,50 $ por millón.

Composer 2 de Cursor supera a Claude Opus 4.6 en benchmarks de programación — con un 86% menos de coste

Cursor lanzó Composer 2 el 19 de marzo, y las cifras son difíciles de ignorar. El modelo obtiene 61,3 en CursorBench, 61,7 en Terminal-Bench 2.0 y 73,7 en SWE-bench Multilingual — todo por encima de Claude Opus 4.6, al que la empresa incluye como comparación directa en sus benchmarks publicados. GPT-5.4 sigue liderando Terminal-Bench con 75,1, pero Composer 2 lo supera en SWE-bench Multilingual.

La diferencia de costes es lo verdaderamente interesante. Composer 2 Standard funciona a 0,50 $/M de entrada y 2,50 $/M de salida. Composer 1.5, lanzado hace seis semanas, costaba 3,50 $/17,50 $. Eso supone una reducción del 86% en el coste de entrada y un recorte similar en la salida. Composer 2 Fast, para tareas sensibles a la latencia, opera a 1,50 $/7,50 $ — todavía muy por debajo de lo que cobran los laboratorios de frontera por una calidad de salida comparable en código.

La apuesta de Cursor es arquitectónica, no simplemente una carrera de benchmarks. Composer 2 es una variante ajustada de Kimi K2.5 — un modelo base chino de código abierto — con preentrenamiento continuado y aprendizaje por refuerzo en tareas de programación de larga duración dentro del entorno de Cursor. La ventana de contexto de 200.000 tokens está optimizada para el uso de herramientas, ediciones multi-archivo y operaciones de terminal. Cursor no intentó construir un modelo de propósito general. Construyó un modelo para una sola tarea y lo entrenó sin descanso para esa tarea.

La lógica de negocio encaja. Anysphere, la empresa detrás de Cursor, no necesita que Composer 2 escriba poesía ni resuma PDFs. Necesita que el modelo cierre diffs, navegue repositorios desconocidos y ejecute cientos de llamadas a herramientas en secuencia sin perder el contexto. Al reducir el alcance, comprimieron el modelo, recortaron el coste de inferencia y aparentemente mejoraron el rendimiento en benchmarks frente a sistemas de propósito general mucho más grandes.

Esto importa más allá del propio producto de Cursor. Es una prueba de concepto del ajuste fino por tarea frente al razonamiento general de frontera: no siempre necesitas el modelo más inteligente de la sala, sino el más enfocado. Si el rendimiento de Composer 2 se mantiene en producción — algo que los primeros informes de desarrolladores sugieren que así es — cabe esperar que otras herramientas de programación sigan la misma estrategia.

La implicación práctica para desarrolladores: ejecutar las tareas agénticas de Cursor a escala acaba de abaratarse significativamente, con mejor retención de contexto en proyectos complejos multi-archivo. Para cualquiera que haga trabajo serio de programación automatizada, esas dos cosas combinadas valen más que puntos brutos en benchmarks.

Cursor Composer 2 coding tools AI models