Nvidia lanza Nemotron 3.5 Lightning, un modelo de agentes abierto de 30B destilado de su propio buque insignia Ultra
Nvidia publicó Nemotron 3.5 Lightning, un modelo de mezcla de expertos de 30B con solo 3B de parámetros activos, pensado para cargas de trabajo de agentes de alto volumen. Es un 30% más rápido que Qwen3.6 35B en el propio banco de pruebas PinchBench de Nvidia.
Nvidia lanzó Nemotron 3.5 Lightning el 11 de agosto, un modelo abierto de 30.000 millones de parámetros con solo 3.000 millones activos por token, destilado de su Nemotron 3 Ultra de mayor tamaño. El objetivo no son los chatbots: son las cargas de trabajo de agentes de larga duración que disparan miles de llamadas a herramientas por sesión.
En PinchBench, el propio banco de pruebas de agentes de Nvidia, Lightning completó una tanda de 10.000 tareas un 30% más rápido que Qwen3.6 35B de Alibaba, manteniéndose competitivo en conocimiento, razonamiento, seguimiento de instrucciones, programación y contexto largo. Nvidia publicó sus recetas de evaluación en NeMo Gym para que otros laboratorios puedan reproducir las cifras en lugar de dar por buenos los números sin más — una respuesta directa al problema crónico de manipulación de benchmarks en la industria.
La arquitectura de mezcla de expertos es la clave. Un modelo de 30B con solo 3B de parámetros activos cuesta una fracción de lo que cuesta servir un modelo denso de 30B, por eso Nvidia posiciona a Lightning como el modelo trabajador por defecto detrás de NeMo Switchyard, un enrutador que lanzó junto con él. Switchyard clasifica las tareas de agentes entrantes y entrega las sencillas y de alto volumen a Lightning, mientras enruta las que requieren razonamiento más profundo hacia Nemotron 3 Ultra. Es una apuesta deliberada: la mayoría del tráfico empresarial de agentes es orquestación repetitiva de herramientas, no razonamiento de frontera, así que pagar precios de modelo insignia por cada paso es un desperdicio.
El licenciamiento también importa aquí. Nemotron 3.5 Lightning se distribuye bajo la licencia OpenMDW-1.1 de Nvidia, que permite uso comercial, y ya está disponible en Hugging Face, ModelScope, OpenRouter y build.nvidia.com como microservicio NVIDIA NIM. El precio de lanzamiento en OpenRouter fue de $0.10 por millón de tokens de entrada y $0.25 por millón de salida — lo bastante barato como para convertirse en el nivel por defecto para pipelines de agentes de alta frecuencia, no una opción de nicho.
El lanzamiento llega una semana después de que Nvidia ayudara a formar la Open Secure AI Alliance de 37 miembros, y refuerza la misma estrategia: Nvidia se posiciona como la capa de infraestructura y modelos abiertos que sostiene la economía de agentes, no solo como el proveedor de chips que vende hacia ella. Con Muse Glimmer de Meta y ahora Nemotron 3.5 Lightning lanzados como modelos de agentes abiertos y compactos, aptos para una sola GPU, con días de diferencia entre sí, el mercado de trabajadores de agentes locales ligeros se está volviendo genuinamente competitivo — buena noticia para quienes no quieren pagar tarifas de modelo de frontera solo para que un agente revise un calendario o rellene un formulario.
Para equipos que construyen pipelines de agentes, vale la pena comparar Lightning con lo que hoy hace la clasificación de llamadas a herramientas — la matemática de parámetros activos por sí sola debería reducir de forma notable el coste de inferencia si la mezcla de tareas se inclina hacia la ejecución rutinaria en lugar del razonamiento novedoso.
Fuentes
Lecturas relacionadas
- Open Source IBM y Red Hat Comprometen 5.000 Millones en Project Lightwell para Asegurar el Open Source con IA
- Modelos de IA Nvidia invierte 5.000 millones en Safe Superintelligence de Ilya Sutskever y abandona las TPU de Google
- Modelos de IA Moonshot AI lanza Kimi K3, el modelo de pesos abiertos más grande jamás publicado con 2,8 billones de parámetros