Volver al Blog
Herramientas de IA 31 de marzo de 2026 5 min read

GPT-5.4 de OpenAI incorpora uso nativo del ordenador — 75% en OSWorld, por encima de los humanos

GPT-5.4 añade capacidades nativas de control del ordenador a la API de OpenAI y Codex, permitiendo a los agentes operar con ratón y teclado en cualquier aplicación. Obtuvo el 75% en OSWorld-Verified, por encima del 72,4% de referencia humana.

GPT-5.4 de OpenAI incorpora uso nativo del ordenador — 75% en OSWorld, por encima de los humanos

OpenAI lanzó GPT-5.4 el 5 de marzo, integrando razonamiento, programación y flujos de trabajo agénticos en un único modelo. La novedad más importante: uso del ordenador de forma nativa.

Los modelos anteriores de OpenAI podían escribir código o planificar tareas. GPT-5.4 puede ejecutarlas directamente. En Codex y la API, el modelo interpreta pantallas, controla ratón y teclado, y opera en distintas aplicaciones para completar flujos de trabajo complejos. No es un complemento ni una capa adicional: está integrado en la arquitectura del modelo.

El benchmark que importa

En OSWorld-Verified, el estándar para evaluar agentes que controlan el ordenador, GPT-5.4 obtuvo el 75%. El rendimiento humano promedio en las mismas tareas es del 72,4%. GPT-5.4 es el primer modelo de OpenAI que supera esa línea de referencia para la automatización de tareas en el escritorio.

En GDPval, que mide el rendimiento en tareas de nivel profesional, GPT-5.4 iguala o supera a profesionales del sector en el 83% de las comparaciones.

Qué incluye exactamente el lanzamiento

Se publicaron tres variantes: GPT-5.4 Standard, GPT-5.4 Thinking (orientado al razonamiento, optimizado para problemas de varios pasos) y GPT-5.4 Pro (máxima capacidad, mayor coste). La ventana de contexto en todas las variantes admite hasta un millón de tokens, la mayor que OpenAI ha puesto a disposición comercial.

Tool Search es una novedad práctica: cuando un agente opera en un ecosistema con cientos de conectores y funciones, encontrar la herramienta adecuada en tiempo de inferencia es en sí mismo un problema no trivial. GPT-5.4 lo resuelve con búsqueda de herramientas integrada, permitiendo a los agentes seleccionar dinámicamente entre conjuntos grandes sin que el desarrollador tenga que prever cada camino posible.

Las Skills —paquetes de flujos de trabajo reutilizables que incluyen instrucciones, ejemplos y código— están disponibles en ChatGPT y pueden aplicarse automáticamente cuando el modelo identifica un contexto relevante.

El giro agéntico

El patrón en todas estas características es el mismo: GPT-5.4 está diseñado para completar tareas, no para asistir con ellas. El uso del ordenador permite actuar sobre el entorno. La búsqueda de herramientas permite navegar sistemas complejos. Un contexto de un millón de tokens permite mantener un proyecto entero en memoria de trabajo. Las variantes Thinking permiten planificar antes de actuar.

La posición competitiva de OpenAI en la carrera agéntica —frente al framework de operadores de Anthropic, los agentes Gemini de Google, y las alternativas de código abierto— depende de que este modelo rinda en producción igual que en los benchmarks.

Esa siempre es la pregunta con los sistemas de uso del ordenador. OSWorld-Verified es un entorno controlado. Los escritorios empresariales reales, no.

OpenAI GPT-5.4 AI Agents Computer Use