OpenAI lanza GPT-5.2 en tres niveles — supera a expertos humanos en el 70% de tareas empresariales
OpenAI ha publicado GPT-5.2 en variantes Instant, Thinking y Pro, reportando que el modelo iguala o supera el rendimiento de expertos humanos en el 70,9% de las tareas empresariales evaluadas, casi el doble que su predecesor. El despliegue llega a suscriptores de pago de ChatGPT sin cambios en los precios.
OpenAI ha publicado GPT-5.2, su último modelo frontera, estructurado en tres niveles de rendimiento: Instant (rápido y eficiente en coste), Thinking (razonamiento en cadena de pensamiento más profundo) y Pro (máxima capacidad, orientado a investigación). El despliegue llega ahora a los suscriptores de pago de ChatGPT sin modificación de los precios de suscripción actuales.
Resultados en benchmarks
El dato principal procede del benchmark interno GDPval de OpenAI, que mide el rendimiento en 44 tareas empresariales reales: GPT-5.2 alcanza el 70,9% de equiparación con expertos humanos, frente al 38,8% de GPT-5.1. Ese casi-doblar en una sola generación es el salto de capacidad más agresivo que OpenAI ha afirmado en esta métrica.
Otros resultados destacados:
- SWE-Bench (ingeniería de software): mejora respecto a GPT-5.1, aunque OpenAI no ha publicado la cifra exacta en el lanzamiento
- ARC-AGI (razonamiento abstracto): mejora notable en resolución de problemas
- Depuración de código, manejo de contextos largos y ejecución de proyectos multifase muestran ganancias medibles según evaluaciones internas de OpenAI
Capacidades
GPT-5.2 incorpora o refina: generación de hojas de cálculo, creación de presentaciones, escritura de código a nivel de producción, percepción de imágenes, comprensión de documentos en contexto largo y orquestación de proyectos multietapa. El anuncio de OpenAI destaca específicamente que el modelo puede “depurar código de producción de forma más fiable, implementar solicitudes de funciones y refactorizar bases de código grandes”, un lenguaje claramente dirigido al mercado de desarrolladores.
Precios en la API
Para desarrolladores con acceso vía API:
- Entrada: 1,75 $ por millón de tokens
- Salida: 14 $ por millón de tokens
- Entradas en caché: descuento del 90% aplicado automáticamente
El coste por token es superior al de GPT-5.1, pero OpenAI argumenta que la mayor eficiencia de tokens hace que lograr calidad equivalente cueste menos en conjunto. Los benchmarkers independientes verificarán esta afirmación en las próximas semanas.
Contexto competitivo
El lanzamiento llega tras el memo de “código rojo” de diciembre del CEO Sam Altman, en el que advertía de la presión competitiva de la serie Gemini 3 de Google. Altman luego matizó la alarma, afirmando que los avances de Gemini fueron “menos significativos de lo temido”. Sea como fuere, la velocidad de llegada de GPT-5.2 y el agresivo encuadre de benchmarks señalan que OpenAI trata la carrera por la supremacía de modelos frontera como una prioridad existencial.
Gemini 3.1 Pro lidera actualmente 13 de 16 benchmarks principales y empata con GPT-5.4 Pro en el índice de Artificial Analysis. GPT-5.2 no cierra esa brecha en todos los frentes, pero la puntuación GDPval, que mide utilidad empresarial práctica en lugar de razonamiento puro, es un movimiento narrativo deliberado orientado a clientes enterprise.
Qué significa para los desarrolladores
El nivel Instant será el predeterminado para la mayoría de integraciones API: menor latencia, menor coste. El nivel Thinking es el relevante para pipelines agénticos con razonamiento multifase. El nivel Pro apunta a aplicaciones de investigación y cargas de trabajo de generación de código compleja donde el coste es secundario.
El énfasis de OpenAI en las mejoras de calidad de código es significativo: la compañía claramente apunta a Cursor, Windsurf y otras herramientas de programación con IA que actualmente enrutan volumen significativo de tokens hacia competidores. Si GPT-5.2 recupera esas cargas de trabajo de código depende de cómo rinda en bases de código reales en manos de desarrolladores, no en las evaluaciones propias de OpenAI.
Lecturas relacionadas
- Modelos de IA Anthropic lanza Claude Fable 5: potencia de clase Mythos con salvaguardas que arrasa en todos los benchmarks de código
- Modelos de IA OpenAI pausa el desarrollo de Astra al rozar por primera vez el nivel de riesgo cibernético 'Crítico'
- Modelos de IA Los propios modelos de OpenAI hackearon Hugging Face para hacer trampa en un test de seguridad