Ponte en Contacto

Temario del curso

Introducción, Objetivos y Estrategia de Migración

  • Objetivos del curso, alineación del perfil de los participantes y criterios de éxito
  • Enfoques de migración de alto nivel y consideraciones de riesgos
  • Configuración de espacios de trabajo, repositorios y conjuntos de datos para laboratorios

Día 1 — Fundamentos de la Migración y Arquitectura

  • Conceptos de Lakehouse, visión general de Delta Lake y arquitectura de Databricks
  • Diferencias entre SMP y MPP e implicaciones para la migración
  • Diseño Medallion (Bronze→Silver→Gold) y visión general de Unity Catalog

Laboratorio Día 1 — Traducción de un Procedimiento Almacenado

  • Migración práctica de un procedimiento almacenado de ejemplo a un notebook
  • Mapeo de tablas temporales y cursores a transformaciones de DataFrame
  • Validación y comparación con la salida original

Día 2 — Delta Lake Avanzado y Carga Incremental

  • Transacciones ACID, registros de confirmación, versionado y viaje en el tiempo
  • Auto Loader, patrones MERGE INTO, actualizaciones (upserts) y evolución de esquemas
  • OPTIMIZE, VACUUM, Z-ORDER, particionado y ajuste de almacenamiento

Laboratorio Día 2 — Ingesta Incremental y Optimización

  • Implementación de la ingesta con Auto Loader y flujos de trabajo MERGE
  • Aplicación de OPTIMIZE, Z-ORDER y VACUUM; validación de resultados
  • Medición de las mejoras en el rendimiento de lectura/escritura

Día 3 — SQL en Databricks, Rendimiento y Depuración

  • Funciones analíticas de SQL: funciones de ventana, funciones de orden superior, manejo de JSON/arreglos
  • Lectura del Spark UI, DAGs, mezclas (shuffles), etapas, tareas y diagnóstico de cuellos de botella
  • Patrones de ajuste de consultas: uniones difuminadas (broadcast joins), sugerencias (hints), almacenamiento en caché y reducción de vertidos (spill)

Laboratorio Día 3 — Refactorización de SQL y Ajuste de Rendimiento

  • Refactorización de un proceso SQL intensivo en SQL de Spark optimizado
  • Uso de trazas de Spark UI para identificar y corregir problemas de sesgo (skew) y mezcla (shuffle)
  • Benchmarking antes/después y documentación de los pasos de ajuste

Día 4 — PySpark Táctico: Reemplazo de Lógica Procedural

  • Modelo de ejecución de Spark: conductor (driver), ejecutores, evaluación perezosa y estrategias de particionado
  • Transformación de bucles y cursores en operaciones vectorizadas de DataFrame
  • Modularización, UDFs/UDFs de pandas, widgets y bibliotecas reutilizables

Laboratorio Día 4 — Refactorización de Scripts Procedurales

  • Refactorización de un script ETL procedural en notebooks de PySpark modulares
  • Introducción a la parametrización, pruebas de estilo de unidad y funciones reutilizables
  • Revisión de código y aplicación de la lista de verificación de mejores prácticas

Día 5 — Orquestación, Pipeline de Extremo a Extremo y Mejores Prácticas

  • Databricks Workflows: diseño de trabajos, dependencias de tareas, desencadenantes y manejo de errores
  • Diseño de pipelines Medallion incrementales con reglas de calidad y validación de esquemas
  • Integración con Git (GitHub/Azure DevOps), CI y estrategias de pruebas para lógica de PySpark

Laboratorio Día 5 — Construcción de un Pipeline Completo de Extremo a Extremo

  • Ensamblaje del pipeline Bronze→Silver→Gold orquestado con Workflows
  • Implementación de registro de eventos (logging), auditoría, reintentos y validaciones automatizadas
  • Ejecución del pipeline completo, validación de salidas y preparación de notas de despliegue

Operacionalización, Gobernanza y Listo para Producción

  • Mejores prácticas de gobernanza, linaje y controles de acceso en Unity Catalog
  • Costos, dimensionado de clústeres, escala automática (autoscaling) y patrones de concurrencia de trabajos
  • Listas de verificación de despliegue, estrategias de reversión y creación de manuales de procedimientos (runbooks)

Revisión Final, Transferencia de Conocimiento y Próximos Pasos

  • Presentaciones de los participantes sobre el trabajo de migración y lecciones aprendidas
  • Análisis de brechas, actividades de seguimiento recomendadas y entrega de materiales de capacitación
  • Referencias, rutas de aprendizaje adicionales y opciones de soporte

Requerimientos

  • Comprensión de los conceptos de ingeniería de datos
  • Experiencia con SQL y procedimientos almacenados (Synapse / SQL Server)
  • Conocimiento de los conceptos de orquestación ETL (ADF o similares)

Audiencia

  • Gestores tecnológicos con experiencia en ingeniería de datos
  • Ingenieros de datos que migran la lógica procedural de OLAP a patrones Lakehouse
  • Ingenieros de plataforma responsables de la adopción de Databricks
 35 Horas

Número de participantes


Precio por participante

Reseñas (1)

Próximos cursos

Categorías Relacionadas