Claude Opus 4.8 de Anthropic lidera los rankings de IA con grandes avances en programación y honestidad en el código
Anthropic lanzó Claude Opus 4.8 el 28 de mayo, recuperando el primer puesto en el Índice de Inteligencia de Artificial Analysis con saltos importantes en codificación, razonamiento científico y detección de errores propios.
Claude Opus 4.8 de Anthropic es el nuevo líder en el Índice de Inteligencia de Artificial Analysis, con una puntuación de 61.4 —4.1 puntos por encima de Opus 4.7 y 1.2 puntos por delante de GPT-5.5. Lanzado el 28 de mayo de 2026, recupera el puesto en benchmarks que Anthropic había cedido brevemente a OpenAI, con mejoras sustanciales en codificación, razonamiento científico y, sobre todo, en cómo el modelo reconoce sus propios errores en el código.
Rendimiento en programación
Opus 4.8 alcanza el 69.2% en SWE-Bench Pro, frente al 64.3% de Opus 4.7, superando tanto a GPT-5.5 como a Gemini 3.1 Pro en ese benchmark. En SWE-Bench Verified llega al 88.6%. El Elo en GDPval-AA sube a 1.890, lo que implica una tasa de victoria de aproximadamente el 67% frente a GPT-5.5 en evaluaciones de agentes directos.
El cambio de comportamiento más destacado: Opus 4.8 tiene unas cuatro veces menos probabilidad que su predecesor de dejar pasar errores en código que acaba de escribir sin señalarlos. Esto no es una métrica abstracta —es un cambio cualitativo en sesiones de trabajo largas. Menos errores silenciosos significa menos tiempo de depuración causado por los propios fallos del modelo.
Razonamiento científico
El modelo lidera Humanity’s Last Exam por un punto sobre GPT-5.5 y supera a Gemini 3.1 Pro en CritPt, una evaluación de física de frontera. La precisión general se sitúa en 46.6%; la tasa de alucinaciones se mantiene prácticamente igual que en Opus 4.7, en torno al 35.9%.
Nueva herramienta de flujo de trabajo dinámico
Opus 4.8 incluye una nueva herramienta de flujo de trabajo dinámico que permite al modelo planificar y adaptar tareas de múltiples pasos sin que el usuario tenga que definir cada etapa de antemano. Es especialmente útil para tareas largas de codificación e investigación donde el camino hacia la solución no está claro desde el principio —el modelo puede reajustar su plan cuando encuentra un callejón sin salida.
Precios
Los precios no han cambiado: 5 dólares por millón de tokens de entrada, 25 dólares por millón de tokens de salida. El prompt caching reduce los costes hasta un 90%; el procesamiento en lote los recorta un 50%. Sin cambios respecto a Opus 4.7.
Dónde sigue quedándose corto
GPT-5.5 sigue liderando en benchmarks de codificación en terminal. La tasa de alucinaciones no bajó de forma significativa. Y la herramienta de flujo de trabajo dinámico es, por ahora, exclusiva de la API —los usuarios de Claude.ai no verán este cambio en su interfaz al lanzamiento.
En definitiva: Opus 4.8 es un paso genuino adelante respecto a 4.7, especialmente para casos de uso con bucles de codificación agentica o tareas de investigación largas. La mejora en la detección de errores propios, por sí sola, justifica la actualización para flujos de trabajo de ingeniería serios.
Fuentes
Lecturas relacionadas
- Modelos de IA Anthropic reconoce que sus propios modelos Claude entraron sin permiso en tres empresas durante pruebas de seguridad
- Modelos de IA Anthropic presenta su S-1 confidencial: 47.000 millones de ingresos y valoración de 965.000 millones
- Modelos de IA Anthropic lanza Claude Opus 4.8 con flujos de subagentes en paralelo