Claude Opus 4.7 ya está disponible — 87,6% en SWE-bench, nuevos controles agénticos, mismo precio
El último modelo flagship de Anthropic alcanza el 87,6% en SWE-bench Verified e introduce un nuevo nivel de esfuerzo xhigh y un sistema de presupuesto de tokens para bucles agénticos, todo al mismo precio de 5/25 dólares por millón de tokens que Opus 4.6.
Anthropic lanzó Claude Opus 4.7 el 16 de abril. SWE-bench Verified se sitúa en el 87,6%: 6,8 puntos por encima del 80,8% de Opus 4.6 y 7 puntos por delante del 80,6% de Gemini 3.1 Pro. En un benchmark interno de 93 tareas de programación, Opus 4.7 resolvió un 13% más que Opus 4.6, incluyendo cuatro problemas que ni Opus 4.6 ni Sonnet 4.6 eran capaces de resolver. El precio no ha cambiado: 5 dólares por millón de tokens de entrada y 25 por millón de salida.
Nuevos controles agénticos
Dos novedades destacan para los desarrolladores. La primera es un nivel de esfuerzo xhigh, una nueva tier entre high y max que permite controlar con más precisión el equilibrio entre razonamiento y latencia en problemas difíciles sin consumir el máximo de cómputo en cada llamada.
La segunda es un sistema de presupuesto de tareas. Indica a Claude un objetivo aproximado de tokens para un bucle agéntico completo y el modelo recibirá una cuenta atrás en tiempo real. Claude lee ese contador, prioriza el trabajo en consecuencia y busca terminar la tarea de forma ordenada antes de agotar el presupuesto. En la práctica, esto ofrece a los desarrolladores una forma de acotar tareas agénticas desbocadas sin depender de timeouts externos duros.
Mejoras de visión
La resolución máxima de imagen aumenta a 2.576 píxeles en el lado largo, aproximadamente 3,75 megapíxeles, más del triple del límite anterior. La mejora es especialmente visible en diagramas técnicos escritos a mano, fotos de pizarras e infografías densas donde los modelos anteriores perdían detalle.
Resumen de benchmarks
| Benchmark | Opus 4.7 | Opus 4.6 |
|---|---|---|
| SWE-bench Verified | 87,6% | 80,8% |
| MCP-Atlas (agéntico) | 77,3% | — |
| CyberGym | 73,1% | — |
Para contexto: GPT-5.4 obtiene el 66,3% en CyberGym. Claude Mythos Preview, el modelo frontier no publicado de Anthropic, alcanza el 83,1% en el mismo benchmark.
Cambio de comportamiento a tener en cuenta
Opus 4.7 ejecuta exactamente el texto proporcionado. Opus 4.6 tendía a rellenar huecos cuando las instrucciones eran ambiguas. Los prompts que dependían de esa inferencia implícita producirán resultados literalmente correctos pero posiblemente equivocados en 4.7. Esto es estrictamente mejor para sistemas en producción que necesitan salidas predecibles, pero conviene probar los prompts existentes antes de migrar.
Actualización del tokenizador
Anthropic también lanzó un tokenizador revisado junto con Opus 4.7. Dependiendo del tipo de contenido, el recuento de tokens puede ser entre 1,0 y 1,35 veces mayor que con el tokenizador anterior. El precio de 5/25 dólares no ha cambiado, pero los flujos de trabajo con presupuesto acotado deben contemplar el posible incremento en el conteo.
Disponibilidad
Opus 4.7 está disponible en Claude.ai, la API de Anthropic, Amazon Bedrock, Google Cloud Vertex AI y Microsoft Foundry. La ventana de contexto se mantiene en 1 millón de tokens.
Anthropic reconoció simultáneamente que Opus 4.7 queda por detrás de su modelo Claude Mythos, filtrado en marzo, en varias tareas de razonamiento avanzado. Eso establece el techo actual para lo que está disponible públicamente.
Lecturas relacionadas
- Herramientas de IA Anthropic despliega 10 agentes de IA para Wall Street — ya operativos en Goldman, JPMorgan y Citi
- Modelos de IA Anthropic reconoce que sus propios modelos Claude entraron sin permiso en tres empresas durante pruebas de seguridad
- Modelos de IA Anthropic presenta su S-1 confidencial: 47.000 millones de ingresos y valoración de 965.000 millones