Volver al Blog
Modelos de IA 8 de mayo de 2026 5 min read

ZAYA1-8B de Zyphra: Un Modelo de Razonamiento MoE Abierto Con 760M Parámetros Activos Entrenado en AMD

Zyphra lanzó ZAYA1-8B bajo licencia Apache 2.0 — un modelo mixture-of-experts con 8.400 millones de parámetros totales pero solo 760M activos por pasada, entrenado íntegramente en hardware AMD Instinct MI300X, que iguala a DeepSeek-V3.2 y se acerca a los modelos de razonamiento frontera en benchmarks matemáticos.

ZAYA1-8B de Zyphra: Un Modelo de Razonamiento MoE Abierto Con 760M Parámetros Activos Entrenado en AMD

Zyphra publicó ZAYA1-8B el 6 de mayo de 2026: un modelo de lenguaje mixture-of-experts que activa solo 760M de sus 8.400 millones de parámetros totales en cada pasada hacia delante, fue entrenado de principio a fin en hardware AMD y se distribuye bajo licencia Apache 2.0.

El recuento de parámetros activos es el titular. En inferencia, ZAYA1-8B consume menos cómputo que un modelo denso de 1.000 millones de parámetros y, sin embargo, rinde muy por encima de lo que su tamaño aparente sugeriría. En el benchmark APEX-shortlist iguala o supera a DeepSeek-V3.2 y GPT-OSS-120B. En benchmarks matemáticos de alta dificultad se acerca a DeepSeek-R1-0528, Gemini-2.5-Pro y Claude 4.5 Sonnet. Para un modelo de acceso libre que puede ejecutarse en hardware de gama media, son cifras notables.

Arquitectura. ZAYA1-8B introduce tres componentes no estándar. La Atención Convolucional Comprimida (CCA) sustituye la atención multi-cabeza estándar por un paso de compresión convolucional que reduce la longitud de las secuencias key/value antes de aplicar la atención, recortando el ancho de banda de memoria en contextos largos. Un enrutador de expertos basado en MLP reemplaza la capa de enrutamiento lineal habitual, permitiendo decisiones de routing más ricas a costa de una pequeña sobrecarga adicional. El escalado de residuo aprendido ajusta dinámicamente la contribución de cada capa durante el entrenamiento; según Zyphra, esto estabiliza el entrenamiento a escala y mejora la precisión final.

Cómputo en tiempo de inferencia. El modelo se combina con el método de inferencia “Markovian RSA” de Zyphra, que genera múltiples trazas de razonamiento en paralelo y segmenta el contexto en ventanas de longitud fija. El diseño proporciona profundidad de razonamiento ilimitada a coste de memoria constante, a diferencia de los enfoques de chain-of-thought en los que la caché KV crece con la longitud de la traza.

Stack de entrenamiento. Todo el proceso se realizó en un clúster de 1.024 GPUs AMD Instinct MI300X en IBM Cloud, conectadas con redes AMD Pensando Pollara. Entrenar ZAYA1-8B íntegramente en hardware AMD sin recurrir a GPUs NVIDIA en ningún momento es en sí mismo una declaración de intenciones: demuestra que el ecosistema MI300X ha madurado lo suficiente para trabajo serio en modelos frontera.

Disponibilidad. ZAYA1-8B está disponible ya como endpoint serverless gratuito en Zyphra Cloud y como descarga completa del modelo en Hugging Face. La licencia Apache 2.0 permite uso comercial sin restricciones.

Para desarrolladores que construyen aplicaciones con razonamiento intensivo, la aritmética es favorable: un modelo que ofrece razonamiento cercano a la frontera con 760M parámetros activos representa un paso relevante hacia el despliegue práctico en hardware con inferencia limitada. Si las ganancias de ZAYA1-8B se mantienen en benchmarks más amplios está aún por comprobar, pero las decisiones arquitectónicas —especialmente CCA y Markovian RSA— son lo suficientemente sólidas para merecer atención de la comunidad open-source de ML.

Zyphra es un laboratorio relativamente joven. ZAYA1-8B es su lanzamiento público más ambicioso hasta la fecha, y la decisión de entrenar sobre AMD a escala refleja tanto un posicionamiento comercial diferenciador frente a la monocultura CUDA como una capacidad real en pipelines de entrenamiento agnósticos al hardware.

ai open-source moe amd llm