
En KubeCon Europe en Ámsterdam, NVIDIA anuncia la donación del controlador de asignación dinámica de recursos (DRA) de GPU a Cloud Native Computing Foundation (CNCF). Esto marca un hito importante para el ecosistema de Kubernetes y el futuro de la infraestructura de inteligencia artificial.
Las GPU han estado en el centro del aprendizaje automático moderno y de las cargas de trabajo informáticas de alto rendimiento durante años, pero integrarlas en Kubernetes requiere herramientas especializadas y componentes específicos del proveedor. La donación de controladores DRA representa un cambio hacia una estandarización más profunda de la orquestación de GPU en entornos nativos de la nube. Al llevar esta tecnología al ecosistema CNCF, NVIDIA está ayudando a garantizar que las capacidades avanzadas de programación de GPU se desarrollen abiertamente junto con la comunidad de Kubernetes en general.
Esta contribución fortalece la posición de Kubernetes como plataforma para cargas de trabajo de IA a gran escala y sienta las bases para una gestión de recursos de GPU más flexible y programable. Para comprender la importancia de esto, es útil comprender el ecosistema más amplio de GPU NVIDIA que admite cargas de trabajo de IA en Kubernetes.
A partir de 2026, el apilamiento de GPU de NVIDIA en Kubernetes se divide en tres capas principales: operadores de GPU, pilas de recursos modernas creadas en torno a DRA y capacidades de orquestación avanzadas, como el programador de IA de Kubernetes (KAI). Juntos, estos componentes transforman la GPU de un simple acelerador de hardware a un recurso de infraestructura completamente orquestado.
Operador de GPU: automatización de la infraestructura de GPU
Operador de GPU NVIDIA Automatice la gestión del ciclo de vida del software necesario para que las GPU funcionen dentro de un clúster de Kubernetes. En lugar de exigir a los administradores que configuren manualmente los controladores, los tiempos de ejecución y las herramientas de monitoreo, los operadores implementan y administran automáticamente estos componentes. Esto proporciona un entorno consistente y listo para producción para cargas de trabajo de GPU.
Los componentes típicos implementados por los operadores incluyen:
- Controlador NVIDIA: Los módulos principales y las bibliotecas de espacio de usuario necesarios para el funcionamiento de la GPU se instalan a través del administrador de controladores en contenedores.
- Kit de herramientas de contenedor NVIDIA: Este componente integra la GPU con un tiempo de ejecución de contenedor (como Containerd o CRI-O), lo que permite que el contenedor acceda al hardware de la GPU y a las bibliotecas CUDA en el nodo.
- Capa de acceso a GPU: Los clústeres han utilizado tradicionalmente complementos de dispositivos NVIDIA para requerir el uso de valores enteros simples de la GPU. Con la introducción del controlador DRA, los clústeres pueden adoptar el nuevo modelo de recursos nativo de Kubernetes. El controlador de GPU instalará y administrará el controlador DRA para la GPU en una próxima versión. El uso de complementos de dispositivos y controladores DRA en el mismo clúster es y será mutuamente excluyente.
- Exportadores de DCGM: Exporte datos de telemetría, como el uso de energía, la temperatura y los indicadores de utilización, a Prometheus para su monitoreo.
- Descubrimiento de funciones de GPU (GFD): Agregue automáticamente etiquetas de características de GPU a los nodos de Kubernetes, como el tamaño de la memoria o la compatibilidad con CUDA.
- Administrador de NVIDIA MIG: Permite GPU modernas como Nvidia H100, Nvidia H200y NVIDIA Blackwell Utilice la tecnología GPU de instancias múltiples (MIG) para dividirla en múltiples ejecuciones lógicas de GPU.
Por lo tanto, el operador de GPU actúa como columna vertebral operativa de la infraestructura de GPU en el clúster de Kubernetes.
Controlador DRA: un modelo de recursos moderno para GPU
El controlador DRA representa la próxima generación de gestión de recursos de GPU para Kubernetes. Históricamente, Kubernetes trataba las GPU como recursos enteros simples. La carga de trabajo solicitará algo como nvidia.com/gpu:1. Si bien es eficaz, este modelo carece del poder expresivo necesario para las cargas de trabajo modernas de IA.
DRA presenta un modelo más completo basado en ResourceClaims, que permite que las aplicaciones requieran capacidades de hardware muy específicas, no solo la cantidad de GPU. 
Los ejemplos incluyen:
- Solicite una GPU conectada a través de NVIDIANVEnlace
- Solicitar porciones de GPU específicas
- Asignar GPU entre nodos que comparten un dominio de memoria
Este nivel de control es fundamental para las cargas de trabajo de capacitación modernas, que a menudo dependen de una comunicación GPU estrechamente acoplada.
DRA también presenta varias características importantes:
- Dominio computacional: Esta abstracción permite múltiples nodos. NVIDIA NVLink comunicar. Sistemas como el GB200 pueden permitir que las cargas de trabajo en múltiples nodos se comporten como si se ejecutaran en una única GPU grande.
- Interfaz de dispositivo contenedor (CDI): CDI no depende de variables de entorno como NVIDIA_VISIBLE_DEVICES, sino que inyecta dispositivos en contenedores a través de interfaces estandarizadas, lo que mejora la confiabilidad y la portabilidad.
A medida que el controlador DRA migra a CNCF, estas capacidades pasan a formar parte del ecosistema abierto más amplio de orquestación de aceleradores.
Programador KAI: programación perceptiva de IA
Ejecutar cargas de trabajo de IA de manera eficiente requiere más que asignar GPU. Requiere comprender las decisiones de programación de cómo se comportan los trabajos de IA. KAI Scheduler agrega una capa de inteligencia además de la programación de Kubernetes. Se basa en el operador de GPU y el controlador DRA para lograr una coordinación de recursos más avanzada. 
Las capacidades principales incluyen:
- Distribución de puntuación de GPU: Varias cargas de trabajo pueden compartir la GPU mediante partición de memoria o división de tiempo.
- Cola jerárquica: A los equipos se les pueden asignar cuotas de GPU y el programador gestiona la equidad y la prioridad dentro de esas cuotas.
- Programación de pandillas para capacitación distribuida: Los grandes trabajos de formación suelen requerir el uso de decenas o cientos de GPU simultáneamente. KAI garantiza que estos trabajos se inicien solo cuando los recursos necesarios estén disponibles, evitando así que los clústeres parcialmente asignados queden inactivos.
Estas capacidades son fundamentales para las organizaciones que ejecutan procesos de capacitación a gran escala o plataformas de IA compartidas.
CNCF Por qué son importantes las donaciones
La donación del controlador DRA a CNCF marca un paso importante para hacer de la orquestación avanzada de GPU un ciudadano de primera clase del ecosistema de Kubernetes. Acelera la adopción del modelo de recursos nativo de Kubernetes para GPU, fomenta la innovación impulsada por la comunidad y fortalece la base para cargas de trabajo de IA a gran escala. A medida que la infraestructura de IA se convierte cada vez más en el núcleo de las plataformas modernas, la colaboración abierta en torno a tecnologías centrales, como la programación de GPU y la asignación de recursos, desempeñará un papel clave en la configuración de la próxima generación de sistemas nativos de la nube.
Ejecutar cargas de trabajo de IA modernas requiere algo más que una GPU y un programador. Requiere una plataforma Kubernetes que sea segura, fácil de operar y capaz de soportar cargas de trabajo aceleradas por hardware a gran escala.
Canonical proporciona una distribución de Kubernetes diseñada para lograr este objetivo. Canonical Kubernetes es una distribución de Kubernetes ligera, segura y fija que incluye todos los elementos necesarios para implementar y operar clústeres listos para producción. Incluye los servicios esenciales que requiere un clúster de Kubernetes, incluido el tiempo de ejecución de contenedores, redes (CNI), DNS, ingreso y otros elementos operativos para que los equipos puedan implementar y administrar clústeres con una sobrecarga operativa mínima. 
Al construir directamente sobre Kubernetes ascendente, Canonical Kubernetes mantiene la compatibilidad con el ecosistema nativo de la nube más amplio al tiempo que simplifica la gestión del ciclo de vida. Las actualizaciones de seguridad y las versiones ascendentes de Kubernetes se entregan de manera optimizada, lo que permite a los equipos mantenerse actualizados sin la complejidad operativa típicamente asociada con el mantenimiento del clúster. Canonical Kubernetes está diseñado para admitir implementaciones en una variedad de entornos; desde pequeños clústeres para experimentos hasta implementaciones de grandes empresas que se ejecutan en múltiples regiones. La plataforma se integra naturalmente con la infraestructura abierta más amplia de Canonical y se beneficia de la confiabilidad y seguridad de Ubuntu.
Para las organizaciones que ejecutan cargas de trabajo de IA, esto proporciona una base estable sobre la cual puede operar el ecosistema de GPU NVIDIA. Se pueden implementar componentes como operadores de GPU, controladores DRA y programadores avanzados en Canonical Kubernetes para admitir canales de aprendizaje automático acelerados por GPU, clústeres de capacitación distribuidos y plataformas de inferencia escalables.
Canonical Kubernetes y el creciente ecosistema de infraestructura de IA de NVIDIA proporcionan juntos los componentes básicos necesarios para ejecutar una infraestructura de IA moderna utilizando tecnologías abiertas y nativas de la nube.









