NVIDIA Lanza Nemotron 3 Nano Omni: Multimodal, de Código Abierto y 9 Veces Más Rápido
NVIDIA ha publicado en abierto un modelo multimodal de 30B parámetros capaz de procesar texto, visión, audio y vídeo en un único paso de inferencia. Supera en 9x el rendimiento de sus rivales y encabeza seis clasificaciones del sector.
NVIDIA publicó Nemotron 3 Nano Omni el 28 de abril bajo una licencia abierta permisiva. Es el primer modelo open source a este nivel de parámetros capaz de procesar texto, imágenes, audio y vídeo en un único paso de inferencia, sin fragmentar las tareas en varios modelos especializados.
La arquitectura es una mezcla de expertos híbrida de 30.000 millones de parámetros con solo 3.000 millones activos por paso directo (30B-A3B). Ese diseño MoE explica el dato más llamativo: 9 veces más rendimiento que otros modelos omni abiertos con el mismo nivel de interactividad, lo que se traduce en una reducción directa de costes para los equipos que lo despliegan a escala.
Lo que Encabeza
Nemotron 3 Nano Omni lidera seis clasificaciones. Inteligencia documental compleja, comprensión de vídeo y comprensión de audio son las categorías más destacadas. En tareas de contexto largo, el modelo maneja documentos, gráficos, transcripciones de audio y fotogramas de vídeo dentro de la misma ventana de contexto unificada, en lugar de enrutar cada modalidad a un pipeline diferente.
La arquitectura multimodal no solo acepta distintos tipos de entrada — razona sobre ellos de forma conjunta. Una consulta que hace referencia tanto a una sección de un documento como a un clip de audio obtiene una respuesta unificada, no dos salidas de modelo separadas unidas artificialmente.
Despliegue Abierto
El modelo está disponible ahora en Hugging Face, OpenRouter y build.nvidia.com, con soporte en más de 25 plataformas asociadas. Entre los primeros adoptantes están Palantir, Foxconn, Docusign y Oracle. Dell, Infosys y Zefr lo están evaluando.
La licencia es Apache 2.0, lo que permite uso comercial, ajuste fino y redistribución sin obligaciones de royalties. Un contraste significativo con otros lanzamientos multimodales frontier que se publican bajo licencias personalizadas con restricciones de uso.
Por Qué Importa para la Infraestructura de Agentes
La mayoría de los agentes de IA en producción hoy encadenan tres o cuatro modelos especializados: uno de visión, uno de transcripción, un modelo de lenguaje y un parser de documentos. Cada transferencia añade latencia, consume tokens e introduce puntos de fallo. Un único modelo omni que gestione las cuatro modalidades internamente reduce tanto la complejidad de la infraestructura como el coste por tarea.
Con solo 3.000 millones de parámetros activos, Nemotron 3 Nano Omni puede ejecutarse eficientemente en una única GPU A100 o H100, lo que lo hace viable para despliegues autoalojados que necesiten capacidad multimodal sin la factura de inferencia de un modelo cerrado frontier. Para equipos empresariales que procesan grandes volúmenes de documentos, grabaciones de reuniones e informes multimedia a diario, la economía cambia sustancialmente.
NVIDIA publicó el informe técnico el 27 de abril; el lanzamiento en Hugging Face llegó el 28. El modelo se publicó sin lista de espera.
Si esto desplaza al mercado de modelos cerrados para tareas omni dependerá de la rapidez con que el ecosistema de ajuste fino se construya a su alrededor. Con 9x el rendimiento y pesos abiertos, cambia la economía de los agentes de IA multimodal de manera significativa de todas formas.
Lecturas relacionadas
- Modelos de IA Meituan publica LongCat-2.0 en código abierto: el modelo de IA de 1,6 billones de parámetros fabricado sin NVIDIA
- Modelos de IA NVIDIA lanza Cosmos 3: el primer omnimodelo abierto para IA física en robótica y vehículos autónomos
- Modelos de IA ZAYA1-8B de Zyphra: Un Modelo de Razonamiento MoE Abierto Con 760M Parámetros Activos Entrenado en AMD