GPT-5.4 llega con uso nativo de ordenador — los agentes ya pueden controlar escritorios completos
OpenAI lanzó GPT-5.4 con capacidades integradas de uso de ordenador, permitiendo que los agentes operen entornos de escritorio de forma autónoma. Es el primer modelo de frontera de propósito general que lo incorpora de forma nativa.
OpenAI lanzó GPT-5.4 el 5 de marzo, desplegándolo en ChatGPT como “GPT-5.4 Thinking”, en la API y en Codex. La capacidad estrella: uso nativo de ordenador. Es el primer modelo de frontera de propósito general capaz de operar un entorno de escritorio completo de forma autónoma — sin scaffolding personalizado, sin necesidad de cambiar a un modelo especializado.
Es un paso arquitectónico significativo.
Qué significa realmente el uso nativo de ordenador
Las implementaciones anteriores de uso de ordenador — incluyendo Claude computer use de Anthropic y experimentos anteriores de OpenAI — requerían modelos especializados entrenados específicamente para la interacción con interfaces gráficas, o capas de automatización frágiles construidas sobre modelos generales.
GPT-5.4 integra el uso de ordenador como una capacidad nativa del modelo de propósito general. En la práctica:
- El modelo puede ver una captura de pantalla del escritorio y ejecutar acciones (clics, entrada de teclado, navegación)
- Puede operar a través de múltiples aplicaciones en un solo flujo de trabajo
- Puede recuperarse de estados inesperados de la interfaz sin fallar
- No requiere un modelo separado de uso de ordenador ni scaffolding personalizado
Para los desarrolladores que construyen productos agénticos, esto elimina una cantidad significativa de infraestructura. El patrón de “usar un modelo general para razonar, llamar a un modelo especializado para la interacción con la GUI” se simplifica.
La capacidad de búsqueda de herramientas
GPT-5.4 también incorpora lo que OpenAI llama “tool search” — la capacidad de navegar ecosistemas de herramientas grandes de forma más fiable.
Esto aborda un punto de dolor real en configuraciones de agentes en producción. Cuando un agente tiene acceso a decenas de servidores MCP o un registro amplio de herramientas, seleccionar la herramienta correcta para un paso dado se vuelve poco fiable. Tool search le da al modelo una forma estructurada de descubrir y seleccionar dentro de catálogos grandes de herramientas sin degradarse a escala.
Para cualquiera que ejecute agentes multi-herramienta complejos en producción, esta es la adición menos llamativa pero potencialmente más útil de forma inmediata.
Contexto y salida
GPT-5.4 también viene con una ventana de contexto de 1M tokens y límites de salida mejorados. La combinación de contexto largo + uso de ordenador + búsqueda de herramientas está diseñada explícitamente para tareas autónomas de larga duración — del tipo que requieren leer grandes repositorios de código, operar a través de múltiples herramientas y mantener un estado coherente durante muchos pasos.
Qué significa para los constructores
Ya no necesitas automatización GUI personalizada. Tareas que antes requerían scripts de Playwright, PyAutoGUI o herramientas RPA especializadas ahora pueden delegarse directamente a GPT-5.4 con una descripción en lenguaje natural de la tarea. Esto no reemplazará toda la automatización — los flujos de trabajo con scripts siguen siendo más rápidos y fiables para tareas repetitivas bien definidas — pero para tareas de automatización novedosas y ad-hoc, el modelo puede encargarse.
El techo de los productos agénticos acaba de subir. Los productos que combinan contexto largo, uso de ordenador y navegación de herramientas pueden ahora abordar flujos de trabajo que antes requerían intervención humana en cada paso no estándar.
Evalúalo contra tus tareas reales. El rendimiento del uso de ordenador varía significativamente según el tipo de tarea y la complejidad de la interfaz. Haz benchmark con tus flujos de trabajo específicos antes de comprometerte con cambios de arquitectura.
Acceso
GPT-5.4 Thinking está disponible en ChatGPT para usuarios Plus/Pro. El acceso por API está disponible a través de la plataforma de OpenAI — model ID gpt-5.4. Los usuarios de Codex lo obtienen como modelo por defecto para flujos de trabajo específicos de código.
Anuncio completo: openai.com/index/introducing-gpt-5-4
Lecturas relacionadas
- Modelos de IA OpenAI Convierte GPT-5.5 Instant en el Modelo Predeterminado de ChatGPT — 52,5% Menos Alucinaciones en Consultas de Alto Riesgo
- Productividad del Desarrollador OpenAI Codex alcanza 1,6 millones de usuarios semanales y lanza un agente dedicado a vulnerabilidades de seguridad
- Modelos IA El M2.7 de MiniMax ejecutó más de 100 ciclos autónomos para ayudar a entrenarse a sí mismo