NVIDIA dona el driver DRA para GPU a la CNCF y compromete $3,8M en cómputo cloud — Kubernetes es el plano de control de la IA
NVIDIA transfirió la gobernanza de su driver Dynamic Resource Allocation para GPUs a la Cloud Native Computing Foundation y ascendió a membresía Platino. AWS, Google Cloud, Microsoft, Red Hat y otros cinco co-gobiernan la donación.
NVIDIA ha donado su driver de Dynamic Resource Allocation (DRA) para GPUs a la Cloud Native Computing Foundation, transfiriendo la gobernanza de un único proveedor a la comunidad open source más amplia de Kubernetes. Al mismo tiempo, NVIDIA ascendió a la categoría de miembro Platino de la CNCF y comprometió 3,8 millones de dólares en cómputo GPU en la nube para apoyar el ecosistema.
AWS, Google Cloud, Microsoft, Red Hat, Canonical, Broadcom, Nutanix y SUSE participan como colaboradores. No es una coalición de proveedores habitual — es esencialmente cada operador importante de plataformas Kubernetes acordando una capa de abstracción de hardware común para GPUs.
Qué hace DRA
Dynamic Resource Allocation es una API de Kubernetes introducida en la versión 1.26 para reemplazar el antiguo framework de device plugins. Mientras los device plugins ofrecían un instrumento rudimentario para exponer GPUs (asignación de dispositivo completo, sin conciencia de topología), DRA permite expresar solicitudes de hardware estructuradas: asignaciones parciales de GPU, requisitos de niveles de memoria específicos, restricciones de topología NVLink, particionamiento Multi-Instance GPU.
Para cargas de trabajo de IA, esto importa. Un trabajo de entrenamiento que necesita 8 H100 conectadas mediante NVSwitch se coloca correctamente. Un pod de inferencia que solo necesita una partición MIG de una GPU no consume una tarjeta entera. La diferencia en utilización del clúster es significativa — DRA puede recuperar entre un 20 y un 30% de capacidad GPU desperdiciada en clústeres típicos con sobreprovisión.
Al donar el driver a la CNCF, NVIDIA pasa de “proveedor que construyó la integración GPU” a “colaborador de un estándar de propiedad comunitaria”. Cualquier proveedor de cloud o hardware puede ahora contribuir, y ninguna empresa controla en solitario la hoja de ruta.
Por qué es un movimiento estratégico
La posición de NVIDIA en chips de IA es dominante, pero esa dominancia crea un problema de gobernanza: si NVIDIA controla tanto el hardware como la integración de software, los clientes se preocupan por el vendor lock-in. Donar DRA a la CNCF neutraliza esa preocupación mientras consolida Kubernetes como el entorno de ejecución preferido para cargas de trabajo GPU.
Es el mismo manual que NVIDIA usó con el ecosistema de CUDA — hacer el modelo de programación tan estándar que el hardware competidor enfrenta un déficit de integración. Salvo que aquí, el beneficiario es explícitamente de múltiples proveedores.
La donación de 3,8 millones de dólares en GPU cloud también es relevante. Los mantenedores de la CNCF pueden ahora ejecutar pipelines de CI/CD en hardware GPU real en lugar de probar contra stubs o pagar de su bolsillo por clústeres de prueba. Eso acelera el ecosistema sin requerir que NVIDIA escriba cada parche.
Qué se publica junto a la donación
El paquete de anuncios incluye:
- Contenedores confidenciales para cargas de trabajo GPU — atestación y cifrado de memoria para privacidad de modelos de IA
- Actualizaciones del KAI Scheduler de NVIDIA — mejor gang scheduling y preferencia basada en prioridad para trabajos de IA
- Nuevas herramientas open source de observabilidad de IA integradas con OpenTelemetry
Qué significa para ingenieros de plataforma
Si ejecutas cargas de trabajo GPU en Kubernetes hoy, vale la pena migrar a DRA. La API de device plugin sigue siendo compatible pero está en modo mantenimiento. La donación a la CNCF significa que DRA será la interfaz estándar en adelante — toda la documentación, integraciones y soporte fluirán desde aquí.
Los equipos de plataforma de los principales proveedores cloud probablemente harán de DRA la interfaz de programación GPU predeterminada antes de finales de 2026. Anticiparse ahora significa configuraciones de clúster más limpias y mejor utilización de hardware cuando más se necesite.
Lecturas relacionadas
- Cloud e Infraestructura Kubernetes v1.36 'Haru': User Namespaces en GA y DRA Mejorado para Cargas de IA y GPU
- Cloud e Infraestructura AWS lanza Graviton5, GPUs Blackwell y Bedrock AgentCore en su Summit de Nueva York
- Cloud e Infraestructura Cloudflare y Stripe Lanzan un Protocolo para que los Agentes de IA Aprovisionen Infraestructura en la Nube sin Intervención Humana