Contacta con nosotros

Temario del curso

Introducción:

  • Apache Spark en el ecosistema Hadoop
  • Introducción breve a Python y Scala

Fundamentos (teoría):

  • Arquitectura
  • RDD
  • Transformaciones y Acciones
  • Estadio, tarea y dependencias

Aprendizaje práctico en el entorno de Databricks:

  • Ejercicios con la API RDD
  • Funciones básicas de acción y transformación
  • PairRDD
  • Uniones (Join)
  • Estrategias de almacenamiento en caché
  • Ejercicios con la API DataFrame
  • SparkSQL
  • DataFrame: select, filter, group, sort
  • UDF (función definida por el usuario)
  • Exploración de la API DataSet
  • Procesamiento en streaming

Aprendizaje práctico sobre implementación en el entorno de AWS:

  • Fundamentos de AWS Glue
  • Diferencias entre AWS EMR y AWS Glue
  • Ejemplos de trabajos en ambos entornos
  • Ventajas y desventajas

Contenido adicional:

  • Introducción a la orquestación con Apache Airflow

Requerimientos

Habilidades de programación (preferiblemente Python y Scala)

Fundamentos de SQL

 21 Horas

Número de participantes


Precio por participante

Reseñas (3)

Próximos cursos

Categorías Relacionadas