Temario del curso
Introducción, objetivos y estrategia de migración
- Objetivos del curso, alineación del perfil del participante y criterios de éxito
- Enfoques de migración de alto nivel y consideraciones de riesgo
- Configuración de espacios de trabajo, repositorios y conjuntos de datos del laboratorio
Día 1 — Fundamentos de la migración y arquitectura
- Conceptos de Lakehouse, descripción general de Delta Lake y arquitectura de Databricks
- Diferencias entre SMP y MPP e implicaciones para la migración
- Diseño Medallion (Bronze→Silver→Gold) y descripción general de Unity Catalog
Laboratorio del Día 1 — Traducción de un procedimiento almacenado
- Migración práctica de un procedimiento almacenado de ejemplo a un notebook
- Mapa de tablas temporales y cursores a transformaciones de DataFrame
- Validación y comparación con la salida original
Día 2 — Delta Lake avanzado y carga incremental
- Transacciones ACID, registros de commit, control de versiones y tiempo viaja (time travel)
- Auto Loader, patrones de MERGE INTO, actualizaciones/inserciones (upserts) y evolución de esquema
- OPTIMIZE, VACUUM, Z-ORDER, particionamiento y ajuste de almacenamiento
Laboratorio del Día 2 — Ingestión incremental y optimización
- Implementación de la ingestión con Auto Loader y flujos de trabajo de MERGE
- Aplicación de OPTIMIZE, Z-ORDER y VACUUM; validación de resultados
- Medición de las mejoras en el rendimiento de lectura/escritura
Día 3 — SQL en Databricks, rendimiento y depuración
- Funcionalidades de SQL analítico: funciones de ventana, funciones de orden superior, manejo de JSON/arrays
- Lectura de la interfaz de Spark, DAGs, intercambios (shuffles), etapas, tareas y diagnóstico de cuellos de botella
- Patrones de ajuste de consultas: uniones de difusión (broadcast joins), sugerencias (hints), caché y reducción de derrames (spill)
Laboratorio del Día 3 — Refactorización de SQL y ajuste de rendimiento
- Refactorización de un proceso de SQL pesado en Spark SQL optimizado
- Uso de las trazas de la interfaz de Spark para identificar y corregir problemas de sesgo (skew) e intercambio (shuffle)
- Pruebas de rendimiento antes/después y documentación de los pasos de ajuste
Día 4 — PySpark táctico: Reemplazo de la lógica procedimental
- Modelo de ejecución de Spark: controlador, ejecutores, evaluación perezosa y estrategias de particionamiento
- Transformación de bucles y cursores en operaciones vectorizadas de DataFrame
- Modularización, UDFs/pandas UDFs, widgets y bibliotecas reutilizables
Laboratorio del Día 4 — Refactorización de scripts procedimentales
- Refactorización de un script ETL procedimental en notebooks de PySpark modulares
- Introducción de parametrización, pruebas de estilo unitario y funciones reutilizables
- Revisión de código y aplicación de una lista de comprobación de mejores prácticas
Día 5 — Orquestación, pipeline de extremo a extremo y mejores prácticas
- Databricks Workflows: diseño de trabajos, dependencias de tareas, desencadenantes y manejo de errores
- Diseño de pipelines Medallion incrementales con reglas de calidad y validación de esquema
- Integración con Git (GitHub/Azure DevOps), CI y estrategias de prueba para la lógica de PySpark
Laboratorio del Día 5 — Construcción de un pipeline completo de extremo a extremo
- Ensamblaje del pipeline Bronze→Silver→Gold orquestado con Workflows
- Implementación de registros (logging), auditoría, reintentos y validaciones automatizadas
- Ejecución del pipeline completo, validación de salidas y preparación de notas de implementación
Operativización, gobernanza y preparación para producción
- Gobernanza de Unity Catalog, linaje y mejores prácticas de controles de acceso
- Costo, dimensionamiento de clústeres, autoescalado y patrones de concurrencia de trabajos
- Listas de comprobación de implementación, estrategias de reversión y creación de libros de operaciones (runbooks)
Revisión final, transferencia de conocimientos y próximos pasos
- Presentaciones de los participantes del trabajo de migración y lecciones aprendidas
- Análisis de brechas, actividades de seguimiento recomendadas y entrega de materiales de capacitación
- Referencias, rutas de aprendizaje adicionales y opciones de soporte
Requerimientos
- Comprensión de los conceptos de ingeniería de datos
- Experiencia con SQL y procedimientos almacenados (Synapse / SQL Server)
- Familiaridad con los conceptos de orquestación de ETL (ADF o similar)
Público
- Gerentes tecnológicos con un fondo en ingeniería de datos
- Ingenieros de datos que estén migrando la lógica procedimental OLAP a patrones de Lakehouse
- Ingenieros de plataforma responsables de la adopción de Databricks
Reseñas (1)
Todos los temas que abarca, aunque muchos fueron muy rápidos, nos da una idea de lo que necesitaremos ahondar. Además me gustó que pudimos hacer practicas, aunque insisto, creo que el curso amerita mas.