Noticias

Implementación de una arquitectura Lakehouse de datos lista para la empresa con Spark y Kyuubi


En Canonical, nos complace anunciar que hemos utilizado la primera versión de la solución para el área de Data Lake preparada para empresas, basada en una combinación de Apache Spark y Apache Kyuubi. Con nuestra fascinante integración de Apache Kyuubi con Spark, puede proporcionar potentes instalaciones de datos de nivel de producción y de código abierto. Nuestro encanto apache kyuubi es Encantadora Spark Apache Spark Bundle, proporcionando una interfaz SQL única y simple para los entusiastas de Big Data Analytics.

Data Lakehouse: descripción arquitectónica

La arquitectura de Lakehouse para el procesamiento y el análisis de datos es un cambio en el paradigma de gestión de datos empresariales. Históricamente, las organizaciones se han visto obligadas a intercambiar entre el almacenamiento en bruto y escalable de lagos de datos y la rápida capacidad de consulta de los almacenes de datos estructurados. El enfoque de LakeHouse une la brecha, lo que permite a las empresas almacenar grandes cantidades de datos estructurados y no estructurados en una sola plataforma, realizar flujos de datos, procesamiento por lotes y análisis rápido, todo incluido en un empaque de integridad de transacciones y gobernanza. El enfoque estandarizado del lago de datos se basa en la integración de Apache Spark y Apache Kyuubi, creando una plataforma donde los datos de lotes y flujos pueden coexistir, procesar a escala y habilitar análisis avanzados e IA/ML de inmediato.

En el corazón de este plano de Lakehouse se encuentra Apache Spark, el motor de procesamiento de datos distribuido estándar de la industria. La memoria de Spark, la arquitectura tolerante a la falla permiten a los usuarios ejecutar ETL de alto rendimiento, conversión de datos y cargas de trabajo iterativas de aprendizaje automático. El enfoque de Canonical utiliza Kubernetes como gerente de clúster para transmitir imágenes de OCI, con el objetivo de modernizar los trabajos de chispa estándar para optimizar los costos y el rendimiento. La integración admite muchas fuentes de datos, como cualquier almacenamiento de almacenamiento y blob de Azure que cumpla con S3 para la ingestión de datos, y otras bases de datos como metástasis para el procesamiento.

Uno de los mayores desafíos en la implementación de Spark Enterprise ha sido proporcionar acceso SQL seguro, de usuarios múltiples y fácil de usar a usuarios comerciales, analistas y científicos de datos. Ahí es donde brilla Apache Kyuubi. Kyuubi es la puerta de enlace SQL de alto rendimiento y múltiple inquilino de Spark, que proporciona un punto final JDBC y ODBC que es ideal para la integración con exploradores de datos como Tableau, Power BI y Apache Superset. A diferencia del propio servidor de segunda mano de Spark, Kyuubi proporciona un aislamiento de sesión real para que cada aplicación o usuario pueda ejecutar su propio contexto seguro de Spark. Esto no solo proporciona una capa adicional de seguridad, sino que también permite la asignación de recursos granulares, las prioridades de carga de trabajo y las auditorías rigurosas, que son capacidades clave en el cumplimiento y la gobernanza dentro de las industrias reguladas.

Un lago encantador adecuado para negocios

Canonical’s Spark y Kyuubi Lakehouse Stack se construyeron para la velocidad y la confiabilidad. De hecho, la implementación se automatiza utilizando el operador encantado de Canonical, que supervisa el ciclo de vida de Spark, Kyuubi y componentes de soporte. Esto incluye la configuración automática del clúster, las actualizaciones rodantes, la tolerancia, los parches de seguridad y la escala elástica de la nube en los entornos de Kubernetes.

La seguridad se encuentra en cada capa del paquete. El lanzamiento del paquete Charmed Apache Spark/Kyuubi incluye cifrado de extremo a extremo, integración nativa con la pila de observabilidad de las especificaciones y seguridad con documentación mejorada. Además, hemos estado liberando varios parches CVE críticos y altos para esto, mejorando la postura de seguridad del producto. Ahora, el paquete incluye respaldo y restauración de Kyuubi, con los beneficios de la confiabilidad y la continuidad del negocio, y agrega actualizaciones en el lugar para minimizar el tiempo de inactividad y la complejidad. El soporte de alta disponibilidad permite a los servidores que ejecutan Kyuubi escalar de manera confiable a cargas de trabajo de misión crítica.

El paquete Spark-Kyuubi es la plataforma agnóstica, admite implementaciones híbridas y de múltiples nubes, así como en las instalaciones locales. El propósito de esto es evitar el bloqueo de los proveedores y permitir a las organizaciones optimizar los costos, el desempeño y el cumplimiento de la infraestructura. Ya sea que eclipse una nueva plataforma de análisis o refactorice las antiguas implementaciones de Hadoop, las soluciones de Canonical proporcionan una manera fácil para el apoyo experto.

Además de las nuevas características y parches de seguridad, esta versión también proporciona una mejor usabilidad y documentación. El proceso de implementación se explica completamente y se proporcionan soluciones a través de canales de especificación estándar, por lo que le recomendamos que lo revise documento y Notas de lanzamiento Y finalmente pruébalo.

Hemos entregado recientemente Webinar «Building de datos de código abierto Lakehouse con Spark y Kyuubi – Engineering Deep Dive» Puede seguir la experiencia de implementación guiada. Todo se reduce a una pila de análisis de big data más segura e innovadora que se puede usar en las empresas o en la nube empresarial. Con nuevos lanzamientos, las organizaciones pueden estar seguros de que se benefician de los análisis de big data de los últimos desarrollos en el dominio de código abierto.

Edificio de datos de código abierto Lakehouse con Spark y Kyuubi: ingeniería de profundidad de inmersión

Spark y Kyuubi: Pruébalo hoy

En resumen, el estandarizado Kyuubi y Data Lakehouse basado en Spark permiten a las organizaciones unificar las arquitecturas de datos, acelerar el análisis y las estrategias de datos futuras. Al combinar la innovación de código abierto con el soporte de nivel empresarial, las especificaciones permiten a las empresas desbloquear el verdadero potencial de sus datos: confiable, eficiente y a gran escala. Invitamos a los ingenieros de datos, arquitectos y entusiastas de TI para que asistan Prueba de soluciones Y obtenga más información sobre cómo ayudarlo a construir aplicaciones e ideas basados ​​en datos de próxima generación.

  • ¿Iniciar un nuevo proyecto de big data? Contáctenos
  • Cree su centro de datos en línea con nuestro Libro Blanco
  • Lea sobre las tendencias de Big Data y AI en nuestro Libro Blanco

Publicaciones relacionadas

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Botón volver arriba