Cloudera Data Analyst Training (IFCD0043)
Formación en Cloudera Data Analyst Training
La especialidad IFCD0043 del catálogo del Servicio Público de Empleo Estatal tiene como objetivo identificar el ecosistema y los retos de código abierto de las herramientas Big Data y aplicar Apache Hive y Apache Impala combinando datasets mediante JOIN o UNION. Son 60 horas de nivel de cualificación profesional 3, dirigidas a analistas de datos y perfiles técnicos que trabajan sobre plataformas de datos distribuidas.
El programa oficial se divide en cinco módulos. Fundamentos de Hadoop, descripción y consultas en Hive e Impala, de 13 horas, cubre el almacenamiento con HDFS, el procesamiento distribuido con YARN, MapReduce y Spark, la integración con Sqoop, la comparación de Hive e Impala frente a bases de datos tradicionales, y la sintaxis básica de consultas con Hue, Beeline y la shell de Impala. Operadores comunes, funciones integradas, administración, almacenamiento y rendimiento, de 13 horas, trata operadores, funciones escalares y de agregación, creación y alteración de bases de datos y tablas, vistas, particionado y elección de formatos de archivo como Avro y Parquet.
Múltiples datasets, funciones analíticas y de ventana, de 12 horas, entra en uniones y joins avanzados, manejo de valores nulos, funciones de ventana deslizante y gestión de datos complejos. Análisis de textos, optimización y extensiones, de 16 horas, aborda expresiones regulares, procesamiento de texto con SerDes, análisis de sentimiento y n-gramas, bucketing, indexación, Hive sobre Spark, optimización de Impala y funciones definidas por el usuario. Por último, Selección de opciones e introducción a Apache Kudu, de 6 horas, compara MapReduce, Hive, Impala y bases de datos relacionales y presenta las tablas Kudu y su uso con Impala.
La formación es eminentemente práctica y se apoya en ejercicios de consulta y modelado sobre el ecosistema Hadoop, con particionado de tablas, formatos Avro y Parquet y técnicas de optimización. Consulta también Desarrollo y Visualización de Datos con Python (IFCD0011) y Creación y Desarrollo de Aplicaciones Web (IFCD0008).
Curso Cloudera Data Analyst Training (IFCD0043) del catálogo del SEPE
¿Eres docente?
¿Quieres saber más?
Bonificable hasta el 100 % para empresas
¿Te interesa esta área?
¿Qué se aprenderá?
Objetivos del curso
- Identificar el ecosistema y los retos de código abierto de herramientas Big Data y aplicar Apache Hive y Apache Impala combinando los datasets con el uso de JOIN o UNION.
- Definir las características generales de Hadoop en almacenamiento, gestión y consulta de datos con Hive e Impala.
- Enumerar los operadores y funciones integradas en el sistema, elaborando bases de datos para la gestión y el tratamiento completo de los datos cargados.
- Formular consultas en las que intervienen múltiples datasets, aplicando funciones analíticas y de ventana.
- Sintetizar expresiones regulares para el análisis de textos y aplicar factores de optimización a Hive e Impala.
- Seleccionar la opción idónea para la gestión de los datos analizados, integrando Apache Kudu en el marco de Impala.
¿Por qué este curso?
Una formación con impacto real y medible
Explora nuestro catálogo de cursos diseñados para profesionales y empresas que buscan dominar las tecnologías más demandadas.
Cifras de éxito
"Este curso nos ha ayudado a tener éxito en nuestro sector."
Testimonios
Contenidos
Temario
A continuación detallamos todos los módulos impartidos en este curso. Si tiene alguna duda o no aparece, contacte con nosotros.
- Módulo 1Fundamentos de Hadoop, descripción y consultas en Hive e Impala
- Módulo 2Operadores comunes, funciones integradas, administración, almacenamiento y rendimiento de los datos
- Módulo 3Múltiples datasets, funciones analíticas y de ventana, gestión de datos complejos
- Módulo 4Análisis de textos, optimización y extensiones de Hive e Impala
- Módulo 5Selección de opciones. Introducción a Apache Kudu
Fundamentos de Hadoop, descripción y consultas en Hive e Impala
13 horas
Fundamentos de Hadoop con almacenamiento HDFS, procesamiento distribuido con YARN, MapReduce y Spark, análisis con Hive e Impala e integración con Sqoop; definición de Hive e Impala, esquema y almacenamiento de datos, comparación con bases de datos tradicionales, casos de utilización, tablas y bases de datos, sintaxis básica de consultas, tipos de datos y uso de Hue, Beeline y la shell de Impala.
Operadores comunes, funciones integradas, administración, almacenamiento y rendimiento de los datos
13 horas
Operadores, funciones escalares y de agregación; administración de datos con creación de bases de datos y tablas, carga y alteración de datos, simplificación de consultas con vistas y almacenamiento de resultados; y almacenamiento y rendimiento con partición de tablas, carga en tablas particionadas, criterios de uso de particiones y elección de formatos de archivo Avro y Parquet.
Múltiples datasets, funciones analíticas y de ventana, gestión de datos complejos
12 horas
Aplicación de múltiples datasets con UNION y joins, manejo de valores NULL en joins y joins avanzados; utilización de funciones analíticas comunes y funciones de ventana con ventanas deslizantes; y gestión de datos complejos con Hive e Impala.
Análisis de textos, optimización y extensiones de Hive e Impala
16 horas
Análisis de texto con expresiones regulares, procesamiento con SerDes en Hive, análisis de sentimiento y n-grams; optimización de Hive con rendimiento de consultas, bucketing, indexación de datos y Hive con Spark; optimización de la ejecución de consultas en Impala; y extensiones con SerDes y formatos personalizados, scripts de transformación, funciones definidas por el usuario y consultas parametrizadas.
Selección de opciones. Introducción a Apache Kudu
6 horas
Comparación entre MapReduce, Hive, Impala y bases de datos relacionales para elegir la mejor opción, y síntesis de Apache Kudu con la descripción de Kudu, sus tablas y el uso de Impala con Kudu.
Metodología
Aprendizaje basado en la práctica
Consultas reales sobre Hive e Impala
El itinerario se apoya en ejercicios de consulta y modelado sobre el ecosistema Hadoop, con Hue, Beeline y la shell de Impala, particionado de tablas, formatos Avro y Parquet y técnicas de optimización. Cada módulo incorpora casos prácticos sobre datos reales. La evaluación es teórico-práctica y continua.


Público objetivo
Formación oficial del catálogo del SEPE
Analistas de datos y perfiles Big Data
Especialidad dirigida a personas con título de Bachiller, Técnico Superior, Grado o Máster o equivalente, certificado de profesionalidad de nivel 3, o que hayan superado la prueba de acceso a ciclos formativos de grado superior o a la universidad. Se valora la experiencia profesional en el sector y se recomienda conocimiento de inglés.
FAQ
Resolvemos tus dudas sobre la formación
Aclaramos las dudas más comunes sobre el curso, desde los requisitos previos hasta la metodología y el soporte disponible, para asegurarte de que estés completamente preparado para aprovechar al máximo esta formación.
Otros cursos
Cursos especializados para impulsar tu negocio
Explora nuestro catálogo de cursos diseñados para profesionales y empresas que buscan dominar las tecnologías más demandadas.






















