Volver al Blog
Modelos de IA 28 de mayo de 2026 5 min read

Anthropic lanza Claude Opus 4.8 con flujos de subagentes en paralelo

Anthropic lanzó Claude Opus 4.8 el 28 de mayo, elevando SWE-bench Verified al 88,6% e incorporando los Dynamic Workflows: una vista previa en Claude Code que ejecuta cientos de subagentes en paralelo en una sola sesión. El precio no cambia respecto a Opus 4.7.

Anthropic lanza Claude Opus 4.8 con flujos de subagentes en paralelo

Anthropic lanzó hoy Claude Opus 4.8, menos de dos meses después de Opus 4.7. El titular es la programación agéntica: SWE-bench Verified sube al 88,6% (desde 87,6%), Terminal-Bench 2.1 alcanza el 74,6% y la puntuación interna de programación agéntica de Anthropic salta del 64,3% al 69,2%. En GPQA Diamond logra un 93,6% y lidera el benchmark de tareas económicas GDPval-AA con 1890 Elo.

Las cifras más interesantes tienen que ver con la fiabilidad. Anthropic afirma que Opus 4.8 tiene 4 veces menos probabilidades que Opus 4.7 de pasar por alto fallos en el código que él mismo escribió, una respuesta directa al problema de un modelo que entrega sus propios bugs con total seguridad. El razonamiento multidisciplinar con herramientas pasó del 54,7% al 57,9%, y es el primer modelo en superar el 10% en el estándar all-pass del Legal Agent Benchmark.

Dynamic Workflows

La función estrella son los Dynamic Workflows, en vista previa de investigación dentro de Claude Code. En lugar de que un solo modelo avance por una tarea de forma lineal, Opus 4.8 planifica el trabajo, despliega cientos de subagentes en paralelo en una sola sesión y verifica sus resultados antes de informar. El ejemplo de Anthropic: migraciones de código de cientos de miles de líneas, ese tipo de trabajo mecánico pero gigantesco que antes obligaba a vigilar a un agente durante horas.

Es un cambio real en cómo se usa el modelo. La unidad de trabajo ya no es “un prompt”, sino “un objetivo descompuesto entre una flota de trabajadores”, con la verificación integrada en el bucle en lugar de añadida al final.

Honestidad y criterio

Anthropic insiste en las mejoras de comportamiento. La compañía describe Opus 4.8 con “mejor criterio, más honestidad sobre su progreso y la capacidad de trabajar de forma independiente durante más tiempo que sus predecesores”. En la práctica, eso significa señalar la incertidumbre en lugar de afirmar avances sin fundamento; el equipo de alineación reporta máximos en “rasgos prosociales como apoyar la autonomía del usuario y actuar en su mejor interés”.

Precio y velocidad

El precio no cambia respecto a Opus 4.7: 5 $ por millón de tokens de entrada y 25 $ por millón de salida. El modo rápido —unas 2,5 veces más veloz— se sitúa en 10 $/50 $ por millón y ahora cuesta unas tres veces menos que los niveles rápidos anteriores.

En benchmarks de agentes cara a cara, Anthropic asegura que Opus 4.8 supera a GPT-5.5 de OpenAI con el mismo coste y se impone a Gemini 3.1 Pro de Google. En el benchmark Super-Agent fue el único modelo que completó todos los casos de principio a fin. La distancia en la frontera de la IA ya se mide en semanas, no en trimestres.

Fuentes

Anthropic Claude Opus 4.8 Claude Code AI agents