NVIDIA lanza Nemotron 3 Super: ventana de 1M de tokens, 12B parámetros activos y diseñado para agentes
Nemotron 3 Super de NVIDIA usa una arquitectura MoE híbrida con 120B parámetros totales y solo 12B activos en inferencia, junto a una ventana de contexto de 1 millón de tokens. Entre los primeros adoptantes están Cursor, CrowdStrike, Palantir, Oracle Cloud y Zoom.
NVIDIA ha publicado Nemotron 3 Super, un modelo de pesos abiertos construido específicamente para flujos de trabajo agénticos. El dato principal es la ventana de contexto: un millón de tokens. Con esa longitud, una sola pasada de inferencia puede contener una base de código completa, un año de comunicaciones empresariales o un corpus de investigación con múltiples documentos — el tipo de contexto que los agentes de múltiples pasos necesitan para no perder el hilo a lo largo de secuencias de tareas largas.
La arquitectura es un diseño de Mezcla de Expertos (MoE) híbrido. El recuento total de parámetros es de 120.000 millones, pero solo 12.000 millones están activos en cada paso de inferencia. Esa proporción — diez veces más capacidad que cómputo activo — es lo que hace atractivos a los grandes modelos MoE para el despliegue empresarial: calidad de modelo de frontera a una fracción del coste computacional. Para organizaciones que ejecutan miles de tareas de agentes simultáneas, esa diferencia de eficiencia se acumula en ahorros reales de infraestructura.
NVIDIA entrenó Nemotron 3 Super con diez billones de tokens de datos, publicados junto a los pesos del modelo. Esa divulgación de datos de entrenamiento es inusual y operativamente importante — las organizaciones que necesitan auditar sobre qué entrenó un modelo, por motivos de cumplimiento o evaluación de sesgos, pueden hacerlo. La mayoría de los proveedores de modelos de frontera no publican ningún dato de entrenamiento.
El modelo está disponible en Hugging Face y a través de la plataforma build.nvidia.com de NVIDIA. También es accesible vía Perplexity y OpenRouter para equipos que prefieren no alojarlo internamente. Entre los primeros adoptantes empresariales se encuentran Cursor para asistencia en programación, CrowdStrike para flujos de análisis de seguridad, Palantir para procesamiento de inteligencia, Oracle Cloud para pipelines de agentes integrados en la nube, y Zoom para funciones de inteligencia en reuniones.
Nemotron 3 Super ocupa el lugar central de una familia de tres modelos. La variante Nano se lanzó en diciembre de 2025 para despliegues en el borde y aplicaciones con baja tolerancia a la latencia. La Ultra — el buque insignia — aún no ha salido. El posicionamiento de NVIDIA ha sido consistente: la Coalición Nemotron, una red de socios que trata la familia de modelos como infraestructura para la IA empresarial en lugar de un producto que compite directamente con OpenAI o Anthropic.
Para los desarrolladores que construyen agentes de múltiples pasos, el contexto de un millón de tokens es el diferenciador práctico. La mayoría de los marcos agénticos de hoy trabajan alrededor de los límites de contexto con fragmentación, resumen y capas de recuperación que introducen latencia y superficie de error. Un modelo que mantiene todo el contexto de forma nativa colapsa esas capas de arquitectura.
El modelo se publica bajo una licencia abierta permisiva que permite el uso comercial sin royalties por despliegue.
Lecturas relacionadas
- Modelos de IA Trinity-Large-Thinking de Arcee AI Es el Modelo de Razonamiento Open Source Más Potente Construido Fuera de China
- Modelos de IA Meituan publica LongCat-2.0 en código abierto: el modelo de IA de 1,6 billones de parámetros fabricado sin NVIDIA
- Modelos de IA ZAYA1-8B de Zyphra: Un Modelo de Razonamiento MoE Abierto Con 760M Parámetros Activos Entrenado en AMD