NVIDIA presenta Rubin CPX: la primera GPU diseñada específicamente para inferencia de IA con contextos de un millón de tokens
NVIDIA anunció el Rubin CPX, la primera clase de GPU arquitectada desde cero para cargas de trabajo de inferencia con contextos de más de 1 millón de tokens, en lugar de para rendimiento de entrenamiento. La plataforma Vera Rubin NVL144 CPX ofrece 8 exaflops por rack con 100 TB de memoria rápida, orientada a generación de vídeo de larga duración y razonamiento de código a escala.
NVIDIA ha presentado el Rubin CPX, una clase de GPU construida desde cero para inferencia de IA de contexto largo con secuencias de un millón de tokens y más. Es una ruptura arquitectónica significativa: todas las GPUs que NVIDIA ha comercializado a escala hasta ahora se han optimizado principalmente para el rendimiento en entrenamiento. Rubin CPX invierte esa prioridad.
Qué hace diferente al chip
El Rubin CPX ofrece hasta 30 petaflops de cómputo en precisión NVFP4, junto con 128 GB de memoria GDDR7 eficiente en coste por GPU. La distinción clave está en lo que acompaña al cómputo: motores dedicados de codificación y decodificación de vídeo y un pipeline de inferencia de contexto largo que procesa secuencias de varios millones de tokens sin la presión sobre la memoria KV-cache que limita actualmente la eficiencia de inferencia en chips orientados al entrenamiento como el H100 o el Blackwell B200 estándar.
A nivel de plataforma, el rack Vera Rubin NVL144 CPX concentra 8 exaflops de rendimiento en IA y 100 TB de memoria rápida. NVIDIA proyecta un potencial de ingresos por tokens de 5.000 millones de dólares por cada 100 millones de dólares de infraestructura desplegada, un planteamiento dirigido directamente a los hyperscalers y proveedores de nube de IA que están construyendo capacidad de inferencia, no a laboratorios de investigación que compran clústeres de entrenamiento.
La disponibilidad está prevista para finales de 2026.
Por qué esto importa para el stack de IA
La limitación por la longitud de contexto es actualmente la restricción más crítica en el despliegue de IA en producción. Modelos como GPT-5, Gemini Ultra y Claude Opus pueden procesar de forma nativa contextos de cientos de miles de tokens. La infraestructura para hacerlo de forma eficiente a escala todavía no existe: la mayoría de la inferencia en producción sigue ejecutándose en chips y frameworks de serving optimizados para cargas de trabajo en lotes de contexto corto.
Rubin CPX apunta directamente a tres categorías de carga de trabajo donde el contexto largo no es negociable: generación de vídeo de larga duración (donde la continuidad coherente de escena requiere mantener miles de fotogramas en atención), razonamiento de código a gran escala (donde un repositorio entero puede necesitar estar en contexto simultáneamente) y flujos de trabajo de IA agéntica (donde el modelo acumula contexto a través de cientos de llamadas a herramientas y observaciones).
La elección de GDDR7, en lugar de la memoria HBM utilizada en chips enfocados al entrenamiento, es una compensación de coste deliberada. La HBM ofrece mayor ancho de banda pero a un coste significativamente más alto por GB. Para cargas de trabajo de inferencia donde se necesita una capacidad enorme pero se puede tolerar un menor ancho de banda de pico, la GDDR7 reduce drásticamente el coste por token para los operadores.
Posición competitiva
Tanto la TPU v5e de Google como la Trainium 2 de Amazon apuntan a la eficiencia en inferencia, pero ninguna ha anunciado un chip arquitectado específicamente con la longitud de contexto como eje de diseño principal. La serie MI350 de AMD se centra en el equilibrio entrenamiento/inferencia. Si Rubin CPX cumple sus especificaciones, NVIDIA tiene una ventana de 18 meses antes de que pueda llegar una respuesta competitiva a escala de producción.
Para los equipos que construyen infraestructura de inferencia de contexto largo hoy: las restricciones son reales pero temporales. El H100 y el Blackwell B200 con estrategias cuidadosas de descarga de KV-cache pueden manejar cargas de trabajo de 1 millón de tokens a un rendimiento reducido. Rubin CPX es el primer chip donde la longitud de contexto es una restricción de diseño de primera clase y no un añadido posterior.
Lecturas relacionadas
- Hardware China permite de nuevo a Alibaba, ByteDance y DeepSeek comprar chips Nvidia H200
- Infraestructura IA Cierre de GTC 2026: DLSS 5, coalición Nemotron y la proyección de 1 billón de dólares de Jensen
- Infraestructura IA NVIDIA GTC 2026: GPUs Vera Rubin, plataforma de agentes NemoClaw e IA física