Composer 2 de Cursor supera a Claude Opus 4.6 en benchmarks de programación — con un 86% menos de coste
Cursor lanzó Composer 2 el 19 de marzo, un modelo de programación ajustado sobre Kimi K2.5 que supera al buque insignia de Anthropic en CursorBench y SWE-bench Multilingual, reduciendo el coste de tokens de entrada de 3,50 $ a 0,50 $ por millón.
Cursor lanzó Composer 2 el 19 de marzo, y las cifras son difíciles de ignorar. El modelo obtiene 61,3 en CursorBench, 61,7 en Terminal-Bench 2.0 y 73,7 en SWE-bench Multilingual — todo por encima de Claude Opus 4.6, al que la empresa incluye como comparación directa en sus benchmarks publicados. GPT-5.4 sigue liderando Terminal-Bench con 75,1, pero Composer 2 lo supera en SWE-bench Multilingual.
La diferencia de costes es lo verdaderamente interesante. Composer 2 Standard funciona a 0,50 $/M de entrada y 2,50 $/M de salida. Composer 1.5, lanzado hace seis semanas, costaba 3,50 $/17,50 $. Eso supone una reducción del 86% en el coste de entrada y un recorte similar en la salida. Composer 2 Fast, para tareas sensibles a la latencia, opera a 1,50 $/7,50 $ — todavía muy por debajo de lo que cobran los laboratorios de frontera por una calidad de salida comparable en código.
La apuesta de Cursor es arquitectónica, no simplemente una carrera de benchmarks. Composer 2 es una variante ajustada de Kimi K2.5 — un modelo base chino de código abierto — con preentrenamiento continuado y aprendizaje por refuerzo en tareas de programación de larga duración dentro del entorno de Cursor. La ventana de contexto de 200.000 tokens está optimizada para el uso de herramientas, ediciones multi-archivo y operaciones de terminal. Cursor no intentó construir un modelo de propósito general. Construyó un modelo para una sola tarea y lo entrenó sin descanso para esa tarea.
La lógica de negocio encaja. Anysphere, la empresa detrás de Cursor, no necesita que Composer 2 escriba poesía ni resuma PDFs. Necesita que el modelo cierre diffs, navegue repositorios desconocidos y ejecute cientos de llamadas a herramientas en secuencia sin perder el contexto. Al reducir el alcance, comprimieron el modelo, recortaron el coste de inferencia y aparentemente mejoraron el rendimiento en benchmarks frente a sistemas de propósito general mucho más grandes.
Esto importa más allá del propio producto de Cursor. Es una prueba de concepto del ajuste fino por tarea frente al razonamiento general de frontera: no siempre necesitas el modelo más inteligente de la sala, sino el más enfocado. Si el rendimiento de Composer 2 se mantiene en producción — algo que los primeros informes de desarrolladores sugieren que así es — cabe esperar que otras herramientas de programación sigan la misma estrategia.
La implicación práctica para desarrolladores: ejecutar las tareas agénticas de Cursor a escala acaba de abaratarse significativamente, con mejor retención de contexto en proyectos complejos multi-archivo. Para cualquiera que haga trabajo serio de programación automatizada, esas dos cosas combinadas valen más que puntos brutos en benchmarks.
Lecturas relacionadas
- Grandes Tecnológicas SpaceX Compra Cursor, el Editor de Código IA, por 60.000 Millones de Dólares
- Grandes Tecnológicas SpaceX adquirirá el editor de código IA Cursor por 60.000 millones en acciones
- Modelos de IA Anthropic lanza Claude Fable 5: potencia de clase Mythos con salvaguardas que arrasa en todos los benchmarks de código