Noticias

7 Consideraciones al construir una arquitectura ML

A medida que crece el número de organizaciones que mueven a los proyectos de ML a la producción, la necesidad de construir arquitecturas confiables y escalables se ha convertido en un problema más apremiante. de acuerdo a BCG (Boston Consulting Group)Solo el 6% de las organizaciones están invirtiendo en mejorar su fuerza laboral para la fuerza laboral calificada de IA. Para cualquier organización que busque alcanzar la madurez de la IA, esta brecha de habilidades puede conducir a la interrupción.

Si bien esta brecha de habilidad parece ser un enfoque puramente para los científicos de datos o los ingenieros de ML, de hecho, afecta a una fuerza laboral mucho más grande de lo que piensa. La seguridad, la privacidad y la infraestructura son tres áreas específicas en las que el aprendizaje automático está remodelando los procesos y las mejores prácticas, lo que significa que los profesionales necesitan remodelar sus habilidades y cómo funcionan.

En este blog, revisaremos las consideraciones más importantes al construir arquitecturas de ML. Detallaremos las diferentes vías para que las empresas alcancen sus objetivos sin tener que invertir mucho o ser bloqueados durante la fase experimental.

1. Construido sobre lo que ya tienes

Por lo general, las organizaciones ya tienen la infraestructura física que necesitan para comenzar a usar AI/ML. En lugar de construir desde cero, primero puede ampliar la capacidad de su infraestructura actual. Entonces, ¿qué significa esto en la práctica? El nombre del juego es identificar componentes subutilizados, lo que significa que pueden tener la capacidad libre necesaria para satisfacer sus necesidades de ML. Tal vez esto significa no usar la capacidad máxima de GPU, o se puede extender al acceso público en la nube a máquinas nuevas.

Al expandir su infraestructura existente, puede reducir la inversión inicial, acelerar la exploración y brindarle a los interesados ​​comerciales tiempo para comprender mejor el posible ROI.

Y es importante recordar que las GPU no siempre son necesarias. Si bien el aprendizaje automático siempre ha sido una gran fuerza impulsora para la adopción de GPU, en las etapas iniciales, puede encontrar que puede comenzar sin ellos. Esto también brinda la ventaja de proporcionar tiempo para las GPU (con la escasez actual de la escasez) que la organización del tiempo está lista para expandir su proyecto ML.

De hecho, al escalar planes AI/ML y ir más allá de la adopción, esto también significa extender la infraestructura de ML subyacente. Esto significa agregar más potencia informática: si bien se puede requerir hardware o almacenamiento adicionales, siempre debe buscar optimizar su infraestructura existente. Puede encontrar que puede desatar algunas de las capacidades que necesita para escalar.

2. Evite las GPU infrautilizadas y optimice su infraestructura

este Informe de infraestructura de inteligencia artificial Lo que compartimos en 2024 es que se están utilizando menos del 50% de las GPU disponibles para las organizaciones encuestadas. La mayoría de los encuestados dijeron que usan la gestión de la cola, los programadores de empleo, las GPU de varios nombres y las cuotas. Estas son soluciones diseñadas para maximizar la eficiencia frente a la escasez de GPU: de hecho, puede continuar escala incluso si no puede comprar otro hardware.

Para optimizar la utilización de GPU, las organizaciones pueden ajustar su arquitectura en diferentes niveles. Primero, la adopción de una solución de orquestación de contenedores garantiza un fácil acceso a las herramientas necesarias para desarrollar e implementar modelos ML. Kubernetes es el estándar de facto para la orquestación de contenedores, pero hay múltiples distribuciones de Kubernetes aguas abajo en el mercado. Las organizaciones deben tener en cuenta sus planes a largo plazo y dónde piensan que la infraestructura crecerá para que la distribución de su elección se pueda llevar a cualquier parte del viaje de ML.

Para aumentar la utilización de GPU, las organizaciones pueden adoptar soluciones de programador de GPU. En caso de potencia informática limitada, los programadores ayudan a asignar cargas de trabajo y utilizar recursos de manera eficiente. Hay una variedad de soluciones disponibles, como Run.ai o volcán, que son compatibles con diferentes plataformas de hardware y distribuciones de Kubernetes.

Haga clic aquí para obtener más información sobre la distribución de Kubernetes de la especificación>

3. Adoptar la plataforma MLOPS

Las operaciones de aprendizaje automático (MLOP) generalmente se definen como DevOps, pero se utilizan para el aprendizaje automático. Su propósito es estandarizar programas de aprendizaje automático dentro de un equipo u organización y, en última instancia, automatizar la implementación de cargas de trabajo.

Hay muchos beneficios para el método MLOP. A menudo, las organizaciones usan diferentes herramientas de cada departamento, que está aislada, lo que obstaculiza la colaboración. Desde el punto de vista de la eficiencia, el uso de una plataforma en una organización no solo reducirá el tiempo dedicado a las tareas repetitivas por parte de los científicos de datos e ingenieros de aprendizaje automático, sino que también fomentará la colaboración. Desde una perspectiva de infraestructura, adoptar el principio de DevOps significa que la arquitectura ML será más simple y, por lo tanto, más fácil de mantener, lo que reduce el riesgo y la sobrecarga para la organización. En términos de brechas tecnológicas, reducir la complejidad de la infraestructura de ML y la construcción de arquitecturas estandarizadas que puedan utilizar los equipos individuales ayudará a simplificar la adopción.

Entonces, ¿qué plataforma MLOP debería adoptar? Hay muchas opciones en el mercado, incluidas las plataformas de código cerrado (como Sagemaker, Wights & Wights & Bias o Vertex AI) o de código abierto, como Charmed Kubeflow.

Charmed Kubeflow Es una distribución estandarizada de Kubeflow, que es una de las plataformas MLOP más populares y ampliamente utilizadas. Es de código abierto, seguro y portátil. Se ejecuta en diferentes entornos, incluidas las nubes públicas o privadas, y admite escenarios híbridos o de múltiples nubes. Puede ejecutarse en cualquier Kubernetes compatible con CNCF, dando a las organizaciones la opción de ejecutarlo en su infraestructura existente.

Obtenga más información sobre las opciones de implementación disponibles en Charmed Kubeflow>.

4. Adoptar una estrategia de nube híbrida

Las organizaciones a menudo consideran nubes públicas o privadas en binario y construyen sus estrategias de IA en una u otra. Sin embargo, ambos son buenos. Comparemos rápidamente lo que traen.

Las nubes privadas a menudo son más rentables, más fáciles de aprobar auditorías y más centrados en los problemas de privacidad que aporta la IA. Esto se debe al hecho de que las organizaciones anfitrionas son completamente soberanas en su nube privada, lo que significa que tienen un control total sobre los datos. Mientras tanto, la escasez de GPU puede plantear un obstáculo significativo para adoptar o establecer cualquier nube de IA, y la inversión inicial es a menudo una fuente de atención para las organizaciones.

Public Cloud proporciona recursos informáticos fáciles de acceder y instancias en el stock, permitiendo una escalabilidad rápida y evitando la subutilización de la infraestructura. Mientras tanto, las nubes públicas a menudo son caras cuando se ejecutan múltiples proyectos de ML, y no todos los datos están disponibles para su uso debido a regulaciones en todo el mundo.

Todas estas consideraciones son la fuerza impulsora detrás de la estrategia de nubes híbridas de una organización, ya que puede proporcionarle lo «mejor de ambos mundos». Por ejemplo, puede usar la nube pública para realizar rápidamente experimentos y validar proyectos de ML porque pueden acceder fácilmente a los recursos de calcular. Una vez que estos proyectos están listos para llevarlos a producción o a mayor escala (por ejemplo, utilizando conjuntos de datos más amplios), su modelo se puede migrar a una implementación de nubes privadas.

Al construir dicha estrategia, las organizaciones deben elegir herramientas portátiles para ejecutarse simultáneamente en entornos públicos y privados. Esto evita la necesidad de una alta habilidad para diferentes soluciones de infraestructura y permite a los profesionales beneficiarse de la misma funcionalidad, independientemente de dónde se ejecute el proyecto. También simplificará el proceso de migración, asegurando el lanzamiento de la producción sin problemas de cualquier proyecto de ML. Por lo general, las soluciones de código abierto son adecuadas para tales casos de uso porque pueden ejecutarse en cualquier lugar.

Obtenga más información sobre la nube híbrida>

5. Seguridad prioritaria

En términos de IA/ML, la seguridad y la privacidad son los dos temas más importantes. Deben considerarse en diferentes niveles de la arquitectura para garantizar la protección completa de los datos y los modelos ML. Por lo tanto, las organizaciones deben construir una arquitectura ML que proporcione seguridad durante todo el ciclo de vida, desde datos y modelos hasta herramientas y hardware.

¿Qué significa esto para su infraestructura? Las organizaciones primero deben establecer una arquitectura que reduzca la vulnerabilidad, especialmente las críticas o el clímax. Esto significa desarrollar una estrategia de parcheo internamente o a través de proveedores de terceros. Las mejores prácticas, como escaneos y actualizaciones regulares, le darán una comprensión clara del empaque utilizado para los proyectos de ML, sus versiones y sus dependencias.

Al mismo tiempo, las organizaciones generalmente tienen más de un proyecto AI/ML que puede acceder a datos o cualquier tubería de ML. El uso de herramientas ML que proporcionan aislamiento de red e integran con los proveedores de gestión de identidad es la base de esta solución.

Lea más sobre los riesgos de seguridad y cómo abordarlos en nuestra descripción general de los riesgos de aprendizaje automático.

6. A medida que creces, upskill

Comenzar con nuevas tecnologías a menudo es desalentador. Hay muchas habilidades que deben obtenerse en un corto período de tiempo, por lo que la prioridad es clave. Trabajar con socios que ya tienen experiencia en el campo acelerarán su adopción de IA y reducirá la sobrecarga inicial. Por ejemplo, es difícil construir una arquitectura ML desde cero, y ajustar una arquitectura existente puede ser más desafiante si ya hay otros tipos de carga de trabajo en producción. Al aprovechar el conocimiento de los socios que han estado allí y ayudar a otros en el mismo lugar que usted, puede evitar las dificultades comunes y construir sus ingenieros con confianza.

Por ejemplo, el Taller MLOPS de Canonical es un compromiso cara a cara de cinco días, donde nuestros expertos lo ayudan a diseñar arquitecturas ML basadas en casos de uso, limitaciones e infraestructura existente.

Mantenimiento después del diseño. La gestión de una plataforma MLOP como Kubeflow requiere un nuevo conjunto de habilidades, que las organizaciones generalmente no tienen. Es por eso que deben considerar las opciones basadas en el conocimiento de los demás nuevamente. En un contexto empresarial, este puede ser soporte empresarial (en forma de parcheo y mantenimiento automáticos, como proporciona Canonical a través de Ubuntu Pro) o eliminar los servicios de alojamiento que cumplen con

La carga de mantener la plataforma MLOP de ingenieros internos. El alojamiento también tiene la ventaja de darles tiempo para mejorar sus habilidades y finalmente se hizo cargo del proveedor de alojamiento.

Obtenga más información sobre las soluciones de IA Enterprise de Canonical>

7. Construir una arquitectura observable

La observabilidad es la base de cualquier infraestructura que se ejecute en producción. Las organizaciones deben observar tanto la pila de hardware como de software. Saber que los modelos ML requieren un desarrollo continuo y los datos a menudo es confuso, una infraestructura de ML confiable incluye herramientas de observabilidad para abordar estos desafíos. Tener alertas y paneles es la base de la arquitectura ML observable, pero las organizaciones también deben garantizar que el registro y el rastreo estén habilitados.

Obtenga más información sobre MLOPS observables en nuestro blog introductorio>

Si tiene curiosidad sobre dónde comenzar o desea acelerar su viaje ML, nuestro taller MLOPS lo ayudará a diseñar su infraestructura de IA para cualquier caso de uso. Nuestros talleres de MLOPS son proporcionados por el equipo de ingeniería de campo MLOPS de Canonical, un equipo de expertos que capacitan, diseñan y implementan infraestructura de IA a todas las escalas en todas las industrias.

Durante este taller, pasamos 5 días con su equipo utilizando herramientas de código abierto (según su infraestructura existente, utilizando herramientas de código abierto) y trabajamos con usted para trabajar con usted para crear arquitecturas avanzadas y de bajo nivel. Puede personalizar la agenda del taller en función de sus necesidades y los temas que son más valiosos para la organización.

Obtenga más información sobre el taller MLOPS:

Lectura adicional

Publicaciones relacionadas

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Botón volver arriba