El Qwen3.8-Max de Alibaba supera a GPT-5.6 Sol y Claude Fable 5 en benchmarks clave
El modelo de 2.4 billones de parámetros de Alibaba lidera OSWorld, Parametric CAD Bench y OmniDocBench, aunque queda por detrás de GPT-5.6 Sol en Terminal-Bench. Los pesos abiertos llegan la próxima semana.
Alibaba lanzó hoy Qwen3.8-Max, un modelo de mezcla de expertos con 2.4 billones de parámetros que activa solo 95.000 millones por solicitud y reclama victorias sobre GPT-5.6 Sol y Claude Fable 5 en varios benchmarks importantes. Las acciones de Alibaba subieron un 6% con la noticia.
Las cifras respaldan el ruido. Qwen3.8-Max lidera OSWorld-Verified con 86.1, Parametric CAD Bench con 91.5 y OmniDocBench 1.5 con 92.1 — todas tareas centradas en visión y del mundo real, no leaderboards sintéticos. En Terminal-Bench 2.1 marca 86.6, por delante de Claude Opus 4.8 y Claude Fable 5 (84.6) pero por detrás del 88.8 de GPT-5.6 Sol.
La programación es donde el salto respecto a su predecesor es más marcado. DeepSWE 1.1 pasa de 21.6 a 56.6. FrontierSWE sube de 40.7 a 73.5. JobBench pasa de 31.3 a 53.4. No son mejoras incrementales — es el tipo de salto que sugiere que Alibaba reentrenó en lugar de simplemente afinar el modelo.
El modelo soporta una ventana de contexto de 1M de tokens, genera hasta 131K tokens de salida y puede consumir un presupuesto de razonamiento de 262K tokens en problemas difíciles. Cinco herramientas integradas vienen de fábrica en la Responses API: code_interpreter, web_search, web_extractor, t2i_search e i2i_search — posicionando a Qwen3.8-Max como un lanzamiento pensado para agentes, no solo para chat.
El precio deja muy atrás a los laboratorios estadounidenses: 2 dólares por millón de tokens de entrada, 6 dólares por millón de salida y 0.25 dólares por entrada en caché. Tanto GPT-5.6 Sol como Claude Fable 5 cobran varias veces eso. Alibaba apuesta a que “suficientemente bueno a una quinta parte del precio” gana contratos empresariales aunque no lidere cada tabla.
Los pesos abiertos de Qwen3.8-Max y de una variante más pequeña, Qwen3.8-27B, llegarán la próxima semana — un movimiento que ni OpenAI ni Anthropic han igualado en este nivel de capacidad. Llega apenas semanas después del lanzamiento en pesos abiertos de Kimi K3 de Moonshot, de 2.8 billones de parámetros, subrayando la velocidad con la que los laboratorios chinos están comprimiendo la distancia con la frontera — y haciéndolo en abierto.
Para los equipos que construyen agentes, el cálculo vuelve a cambiar: Qwen3.8-Max no es el modelo más inteligente en cada tarea, pero puede ser el más inteligente por dólar, con uso de herramientas integrado desde el primer día.
Fuentes
Lecturas relacionadas
- Modelos de IA Alibaba presenta Qwen3.8-Max, un modelo de 2,4 billones de parámetros que dice superar a todos menos a Fable 5
- Modelos de IA Qwen 3.7 Max de Alibaba Establece Nuevos Referentes para Modelos de Agentes IA con Contexto de 1M Tokens
- Modelos de IA Qwen3.6-27B de Alibaba Supera a un Modelo MoE de 397B en Codificación — El Modelo de Código Abierto que Vale la Pena Autoalojar