Qwen-UI-Agent de Alibaba supera a GPT-5.6 y Claude Opus 4.8 controlando pantallas — y los pesos son gratis
El nuevo agente GUI de Alibaba logra un 82,1% en MobileWorld, 12 puntos por delante de GPT-5.6, y alcanza un 92,2% en móviles Android reales. Los modelos abiertos de 2B y 8B pueden ejecutarse en el propio dispositivo, sin API comercial a la vista.
El equipo Tongyi-MAI de Alibaba lanzó esta semana Qwen-UI-Agent, un agente GUI que lee una pantalla y la maneja directamente — sin API de aplicaciones, sin instrumentación — y sus números en los benchmarks son difíciles de ignorar. En MobileWorld, la evaluación estándar de agentes móviles, logra un 82,1%, superando a GPT-5.6 por 12 puntos porcentuales y a Claude Opus 4.8 por 14,6. En tareas ejecutadas sobre móviles Android físicos, en lugar de emuladores, la puntuación sube al 92,2%. En AndroidDaily, una evaluación más amplia sobre teléfonos reales, alcanza el 97,5%.
En escritorio la historia se sostiene. En OSWorld-Verified, el benchmark de uso de ordenador, Qwen-UI-Agent registra un 79,5%, por delante de GPT-5.5 y de Gemini 3.1 Pro — en una prueba donde los sistemas occidentales comparables llevan meses estancados entre los 70 y 75 puntos.
Dos cosas distinguen este lanzamiento del ciclo de prensa habitual de los benchmarks. La primera: los pesos son abiertos. MAI-UI-2B y MAI-UI-8B están en Hugging Face, con el código en GitHub bajo Tongyi-MAI/MAI-UI. La segunda: los tamaños importan. Un modelo de 2B que maneja la interfaz de un teléfono puede, de forma plausible, ejecutarse en el propio teléfono, y eso cambia por completo el cálculo de privacidad — los agentes de lectura de pantalla de OpenAI y Anthropic envían capturas de todo lo que haces a un centro de datos. Un agente en el dispositivo no tiene por qué hacerlo.
El enfoque de entrenamiento explica la ventaja en dispositivos reales. Alibaba entrenó con datos recogidos de más de 100 móviles físicos ejecutando 150 aplicaciones distintas, en lugar de apoyarse en emuladores, y construyó un benchmark propio con más de 400 tareas. Las pantallas reales son más caóticas que las emuladas — las notificaciones interrumpen, los teclados aparecen, las apps se ralentizan — y que la brecha de 10 puntos entre emulador y dispositivo real corra en la dirección favorable sugiere que ese caos estaba en los datos de entrenamiento desde el principio.
Alibaba también incluyó salvaguardas: el modelo rechaza tareas que marca como ilegales o de alto riesgo, y se detiene ante operaciones sensibles — pagos, borrado de datos, autorizaciones de privacidad — pidiendo confirmación explícita del usuario antes de continuar. Lo que nadie ha respondido es qué ocurre cuando terceros hagan fine-tuning de los pesos abiertos sin esas restricciones. No hay API comercial ni precios de despliegue anunciados, lo que parece una decisión deliberada: esto es una jugada de ecosistema, no un producto.
El patrón ya es inconfundible. Los lanzamientos abiertos de Alibaba siguen aterrizando por encima de los modelos frontera cerrados en benchmarks agénticos — hoy el control de interfaces, tras un año de modelos Qwen copando lo alto de las clasificaciones abiertas. Para los desarrolladores que construyen automatización sobre control de pantalla, el cálculo acaba de cambiar: el mejor agente GUI móvil disponible es uno que puedes descargar, inspeccionar y ejecutar tú mismo.
Fuentes
Lecturas relacionadas
- Modelos de IA Nvidia lanza Nemotron 3.5 Lightning, un modelo de agentes abierto de 30B destilado de su propio buque insignia Ultra
- Modelos de IA El Qwen3.8-Max de Alibaba supera a GPT-5.6 Sol y Claude Fable 5 en benchmarks clave
- Modelos de IA Alibaba presenta Qwen3.8-Max, un modelo de 2,4 billones de parámetros que dice superar a todos menos a Fable 5