Streaming de Datos y Procesamiento en Tiempo Real
Visión General del Curso
Este curso ofrece una introducción práctica y estructurada para la construcción de sistemas de streaming de datos en tiempo real. Cubre conceptos centrales, patrones arquitectónicos y herramientas industriales utilizadas para procesar datos continuos a gran escala. Los participantes aprenderán cómo diseñar, implementar y optimizar tuberías de streaming (pipelines) utilizando marcos de trabajo modernos. El curso avanza desde ideas fundamentales hasta aplicaciones prácticas, permitiendo a los estudiantes construir con confianza soluciones listas para producción en tiempo real.
Formato del Entrenamiento
• Sesiones dirigidas por instructores con explicaciones guiadas
• Recorridos conceptuales con ejemplos del mundo real
• Demostraciones prácticas y ejercicios de codificación
• Laboratorios progresivos alineados con los temas diarios
• Discusiones interactivas y preguntas y respuestas
Objetivos del Curso
• Comprender los conceptos de streaming de datos en tiempo real y la arquitectura del sistema
• Diferenciar entre modelos de procesamiento de datos por lotes (batch) y por streaming
• Diseñar tuberías de streaming escalables y tolerantes a fallas
• Trabajar con herramientas y marcos de trabajo distribuidos para streaming
• Aplicar procesamiento por tiempo de evento, técnicas de ventanas (windowing) y operaciones con estado
• Construir y optimizar soluciones de datos en tiempo real para casos de uso empresarial
Temario del curso
Temario del Día 1
• Introducción a los conceptos de streaming de datos
• Fundamentos del procesamiento por lotes vs. en tiempo real
• Bases de la arquitectura dirigida por eventos (event-driven)
• Casos de uso comunes en la industria
• Resumen del ecosistema de streaming
Día 2
• Patrones de diseño arquitectónico para streaming
• Fundamentos de sistemas de mensajería distribuida
• Productores y consumidores
• Temas, particiones y flujo de datos
• Estrategias de ingesta de datos
Día 3
• Conceptos de procesamiento de streaming y marcos de trabajo
• Tiempo de evento vs. tiempo de procesamiento
• Técnicas de ventanas (windowing) y casos de uso
• Procesamiento de streaming con estado
• Bases de tolerancia a fallas y puntos de control (checkpointing)
Día 4
• Transformación de datos en tuberías de streaming
• ETL y ELT en sistemas en tiempo real
• Gestión y evolución del esquema (schema)
• Uniones de flujos y enriquecimiento de datos
• Introducción a servicios de streaming basados en la nube
Día 5
• Monitoreo y observabilidad en sistemas de streaming
• Bases de seguridad y control de acceso
• Ajuste de rendimiento y optimización
• Revisión del diseño de la tubería de extremo a extremo
• Casos de uso del mundo real, como detección de fraude y procesamiento de IoT
Los cursos públicos requieren más de 5 participantes.
Streaming de Datos y Procesamiento en Tiempo Real - Reserva
Streaming de Datos y Procesamiento en Tiempo Real - Consulta
Streaming de Datos y Procesamiento en Tiempo Real - Solicitud de consultoría
Reseñas (2)
Un viaje por el mundo de Spark: un curso muy intenso. DSL, Spark SQL, particionamiento versus agrupación para mí.
Georgiana Elisabeta
Curso - Apache Spark Fundamentals
Traducción Automática
Ejercicios prácticos. La clase debería haber durado 5 días, pero los 3 días fueron útiles para aclarar muchas de las preguntas que tenía al trabajar con NiFi.
James - BHG Financial
Curso - Apache NiFi for Administrators
Traducción Automática
Próximos cursos
Cursos Relacionados
Apache Iceberg Avanzado
21 HorasEsta formación en vivo con instructores en <ubicación> (en línea o presencial) está dirigida a profesionales de datos de nivel avanzado que deseen optimizar los flujos de procesamiento de datos, garantizar la integridad de los datos e implementar soluciones robustas de lakehouse que puedan manejar las complejidades de las aplicaciones modernas de big data.
Al final de esta formación, los participantes serán capaces de:
- Adquirir una comprensión profunda de la arquitectura de Iceberg, incluida la gestión de metadatos y el diseño de archivos.
- Configurar Iceberg para un rendimiento óptimo en diversos entornos e integrarlo con múltiples motores de procesamiento de datos.
- Gestionar tablas Iceberg a gran escala, realizar cambios complejos en el esquema y manejar la evolución de las particiones.
- Dominar técnicas para optimizar el rendimiento de las consultas y la eficiencia del escaneo de datos para grandes conjuntos de datos.
- Implementar mecanismos para garantizar la consistencia de los datos, gestionar garantías transaccionales y manejar fallos en entornos distribuidos.
Fundamentos de Apache Iceberg
14 HorasEsta formación presencial impartida por un instructor en Panama (en línea o in situ) está dirigida a profesionales de datos principiantes que desean adquirir el conocimiento y las habilidades necesarias para utilizar eficazmente Apache Iceberg en la gestión de conjuntos de datos a gran escala, garantizar la integridad de los datos y optimizar los flujos de trabajo de procesamiento de datos.
Al finalizar esta formación, los participantes serán capaces de:
- Obtener una comprensión exhaustiva de la arquitectura, las características y los beneficios de Apache Iceberg.
- Aprender sobre formatos de tabla, particionamiento, evolución del esquema y capacidades de viaje en el tiempo.
- Instalar y configurar Apache Iceberg en distintos entornos.
- Crear, gestionar y manipular tablas Iceberg.
- Comprender el proceso de migración de datos desde otros formatos de tabla hacia Iceberg.
Análisis de Big Data con Google Colab y Apache Spark
14 HorasEsta formación en vivo, impartida por instructores en Panama (en línea o presencial), está dirigida a científicos de datos e ingenieros de nivel intermedio que desean utilizar Google Colab y Apache Spark para el procesamiento y análisis de big data.
Al finalizar esta formación, los participantes podrán:
- Configurar un entorno de big data utilizando Google Colab y Spark.
- Procesar y analizar grandes conjuntos de datos de forma eficiente con Apache Spark.
- Visualizar big data en un entorno colaborativo.
- Integrar Apache Spark con herramientas basadas en la nube.
Inteligencia de Negocios de Big Data para Agencias del Gobierno
35 HorasLos avances tecnológicos y el creciente volumen de información están transformando la manera en que se llevan a cabo los negocios en muchas industrias, incluido el sector gubernamental. La generación de datos por parte del gobierno y las tasas de archivo digital están en aumento debido al rápido crecimiento de dispositivos móviles y aplicaciones, sensores y dispositivos inteligentes, soluciones de computación en la nube y portales dirigidos a los ciudadanos. A medida que la información digital se expande y se vuelve más compleja, también lo hacen la gestión, el procesamiento, el almacenamiento, la seguridad y la disposición de la misma. Nuevas herramientas de captura, búsqueda, descubrimiento y análisis están ayudando a las organizaciones a obtener ideas valiosas a partir de sus datos no estructurados. El mercado gubernamental está en un punto de inflexión, comprendiendo que la información es un activo estratégico, y el gobierno necesita proteger, aprovechar y analizar tanto la información estructurada como la no estructurada para servir mejor y cumplir con los requisitos misionales. A medida que los líderes gubernamentales se esfuerzan por evolucionar hacia organizaciones impulsadas por datos para lograr exitosamente su misión, están sentando las bases para correlacionar las dependencias entre eventos, personas, procesos e información.
Las soluciones gubernamentales de alto valor se crearán a partir de una combinación de las tecnologías más disruptivas:
- Dispositivos y aplicaciones móviles
- Servicios en la nube
- Tecnologías y redes de negocio social
- Big Data y analítica
El Big Data es una de las soluciones inteligentes del sector y permite al gobierno tomar mejores decisiones mediante la acción basada en patrones revelados por el análisis de grandes volúmenes de datos, relacionados o no, estructurados o no estructurados.
Pero lograr estas hazañas requiere mucho más que simplemente acumular cantidades masivas de datos. "Dar sentido a estos grandes volúmenes de Big Data requiere herramientas y tecnologías de vanguardia que puedan analizar y extraer conocimiento útil de flujos vastos y diversos de información", escribieron Tom Kalil y Fen Zhao de la Oficina de Política de Ciencia y Tecnología de la Casa Blanca en un artículo en el blog de OSTP.
La Casa Blanca dio un paso hacia la ayuda a las agencias para encontrar estas tecnologías cuando estableció la Iniciativa Nacional de Investigación y Desarrollo de Big Data en 2012. La iniciativa incluyó más de 200 millones de dólares para aprovechar al máximo la explosión de Big Data y las herramientas necesarias para analizarlo.
Los desafíos que plantea el Big Data son casi tan desalentadores como su promesa es alentadora. Almacenar los datos de manera eficiente es uno de estos desafíos. Como siempre, los presupuestos son ajustados, por lo que las agencias deben minimizar el costo por megabyte del almacenamiento y mantener los datos fácilmente accesibles para que los usuarios puedan obtenerlos cuando lo deseen y de la manera en que lo necesiten. Respaldo de grandes cantidades de datos aumenta este desafío.
Analizar los datos eficazmente es otro gran desafío. Muchas agencias emplean herramientas comerciales que les permiten sift a través de las montañas de datos, identificando tendencias que pueden ayudarles a operar con mayor eficiencia. (Un estudio reciente de MeriTalk descubrió que los ejecutivos de TI federales piensan que el Big Data podría ayudar a las agencias a ahorrar más de 500 mil millones de dólares mientras también cumplen los objetivos misionales.).
Las herramientas personalizadas desarrolladas para Big Data también están permitiendo a las agencias abordar la necesidad de analizar sus datos. Por ejemplo, el Grupo de Análisis de Datos Computacionales del Laboratorio Nacional Oak Ridge ha hecho disponible su sistema de análisis de datos Piranha a otras agencias. El sistema ha ayudado a los investigadores médicos a encontrar una conexión que puede alertar a los médicos sobre aneurismas aórticos antes de que ocurran. También se usa para tareas más rutinarias, como el cribado de currículos para conectar candidatos con gerentes de contratación.
Una introducción práctica al análisis de datos y Big Data - 3 días
21 HorasLos participantes que completen esta formación presencial impartida por un instructor en Panama adquirirán una comprensión práctica y real del Big Data, así como de sus tecnologías, metodologías y herramientas relacionadas.
Los participantes tendrán la oportunidad de poner en práctica este conocimiento mediante ejercicios prácticos. La interacción grupal y los comentarios del instructor son componentes importantes del curso.
El curso comienza con una introducción a los conceptos elementales del Big Data, luego avanza hacia los lenguajes de programación y las metodologías utilizadas para realizar el análisis de datos. Finalmente, discutimos las herramientas e infraestructura que permiten el almacenamiento de Big Data, el procesamiento distribuido y la escalabilidad.
Big Data y Analítica Avanzada
42 HorasBig Data y Analítica Avanzada es la aplicación de técnicas y herramientas sofisticadas para analizar grandes conjuntos de datos complejos con el fin de obtener información accionable y apoyar la toma de decisiones estratégicas.
Esta formación en vivo impartida por un instructor (en línea o presencial) está dirigida a profesionales de datos avanzados que deseen aprovechar métodos analíticos de vanguardia y tecnologías de big data para realizar análisis predictivos, prescriptivos y en tiempo real.
Al finalizar esta formación, los participantes podrán:
- Diseñar e implementar pipelines de procesamiento de datos a gran escala para datos estructurados y no estructurados.
- Aplicar técnicas avanzadas de aprendizaje automático (machine learning) y aprendizaje profundo (deep learning) a conjuntos masivos de datos.
- Aprovechar marcos de computación distribuida para análisis en tiempo real y transmisión de datos (streaming).
- Integrar el análisis de big data en sistemas de inteligencia empresarial y toma de decisiones.
Formato del curso
- Clases interactivas y discusión.
- Amplia cantidad de ejercicios y práctica.
- Implementación práctica en un entorno de laboratorio en vivo.
Opciones de personalización del curso
- Para solicitar una formación personalizada para este curso, por favor contáctenos para organizarla.
Apache NiFi para administradores
21 HorasApache NiFi es una plataforma de integración de datos basada en flujos y procesamiento de eventos de código abierto. Permite el enrutamiento, la transformación y la mediación de sistemas entre diferentes plataformas de manera automatizada y en tiempo real, con una interfaz web y un control fino.
Esta formación presencial o remota e impartida por un instructor está dirigida a administradores e ingenieros de nivel intermedio que deseen desplegar, administrar, asegurar y optimizar los flujos de datos de NiFi en entornos de producción.
Al final de esta formación, los participantes serán capaces de:
- Instalar, configurar y mantener clústeres de Apache NiFi.
- Diseñar y gestionar flujos de datos desde diversas fuentes y puntos finales.
- Implementar lógica de automatización, enrutamiento y transformación de flujos.
- Optimizar el rendimiento, monitorear operaciones y resolver problemas.
Formato del Curso
- Conferencia interactiva con discusión sobre arquitecturas reales.
- Prácticas de laboratorio: creación, despliegue y gestión de flujos.
- Ejercicios basados en escenarios en un entorno de laboratorio en vivo.
Opciones de Personalización del Curso
- Para solicitar una formación personalizada para este curso, por favor contáctenos para organizarlo.
PySpark y Aprendizaje Automático
21 HorasEsta formación ofrece una introducción práctica para construir flujos de trabajo escalables de procesamiento de datos y aprendizaje automático utilizando PySpark. Los participantes aprenderán cómo funciona Apache Spark dentro de los ecosistemas modernos de Big Data y cómo procesar conjuntos de datos grandes de manera eficiente aplicando principios de computación distribuida.
Fundamentos de Apache Spark
21 HorasEsta formación en vivo impartida por un instructor en Panama (en línea o presencial) está dirigida a ingenieros que deseen configurar e implementar un sistema Apache Spark para procesar grandes volúmenes de datos.
Al finalizar esta formación, los participantes serán capaces de:
- Instalar y configurar Apache Spark.
- Procesar y analizar conjuntos de datos muy grandes con rapidez.
- Comprender las diferencias entre Apache Spark y Hadoop MapReduce, así como saber cuándo utilizar cada uno.
- Integrar Apache Spark con otras herramientas de aprendizaje automático.
Administración de Apache Spark
35 HorasEsta formación en vivo impartida por un instructor en Panama (en línea o presencial) está dirigida a administradores de sistemas de nivel principiante e intermedio que deseen implementar, mantener y optimizar clústeres de Spark.
Al finalizar esta formación, los participantes podrán:
- Instalar y configurar Apache Spark en diversos entornos.
- Gestionar los recursos del clúster y monitorizar las aplicaciones de Spark.
- Optimizar el rendimiento de los clústeres de Spark.
- Implementar medidas de seguridad y garantizar una alta disponibilidad.
- Depurar y solucionar problemas comunes de Spark.
Apache Spark en la nube
21 HorasLa curva de aprendizaje de Apache Spark es empinada al inicio, ya que se requiere mucho esfuerzo para obtener los primeros resultados. Este curso tiene como objetivo superar esta etapa inicial más difícil. Tras completar este curso, los participantes comprenderán los fundamentos de Apache Spark, podrán diferenciar claramente entre RDD y DataFrame, aprenderán a usar las API de Python y Scala, entenderán cómo funcionan los executores y las tareas, entre otros aspectos. Además, siguiendo las mejores prácticas, el curso se centra fuertemente en la implementación en la nube, Databricks y AWS. Los estudiantes también comprenderán las diferencias entre AWS EMR y AWS Glue, uno de los últimos servicios de Spark ofrecidos por AWS.
PÚBLICO OBJETIVO:
Ingenieros de Datos, DevOps, Científicos de Datos
Python y Spark para Big Data (PySpark)
21 HorasEn esta formación en vivo y con instructor en Panama, los participantes aprenderán cómo usar Python y Spark juntos para analizar big data mientras realizan ejercicios prácticos.
Al finalizar esta capacitación, los participantes podrán:
- Aprender cómo usar Spark con Python para analizar Big Data.
- Realizar ejercicios que imitan casos del mundo real.
- Utilizar diversas herramientas y técnicas para el análisis de datos masivos usando PySpark.
Python, Spark y Hadoop para Big Data
21 HorasEsta formación en vivo impartida por un instructor en Panama (en línea o presencial) está dirigida a desarrolladores que desean utilizar e integrar Spark, Hadoop y Python para procesar, analizar y transformar conjuntos de datos grandes y complejos.
Al finalizar esta formación, los participantes podrán:
- Configurar el entorno necesario para comenzar a procesar big data con Spark, Hadoop y Python.
- Comprender las características, componentes principales y arquitectura de Spark y Hadoop.
- Aprender cómo integrar Spark, Hadoop y Python para el procesamiento de grandes datos.
- Explorar las herramientas del ecosistema de Spark (Spark MLlib, Spark Streaming, Kafka, Sqoop, Kafka y Flume).
- Construir sistemas de recomendación mediante filtrado colaborativo similares a los de Netflix, YouTube, Amazon, Spotify y Google.
- Utilizar Apache Mahout para escalar algoritmos de aprendizaje automático.
Stratio: Módulos Rocket e Intelligence con PySpark
14 HorasStratio es una plataforma centrada en los datos que integra big data, inteligencia artificial (IA) y gobernanza en una única solución. Sus módulos Rocket e Intelligence permiten la exploración rápida de datos, su transformación y el análisis avanzado en entornos empresariales.
Este curso en vivo con instructor (en línea o presencial) está dirigido a profesionales de los datos de nivel intermedio que deseen utilizar eficazmente los módulos Rocket e Intelligence de Stratio con PySpark, centrándose en estructuras de bucle, funciones definidas por el usuario y lógica avanzada de datos.
Al finalizar este curso, los participantes podrán:
- Navegar y trabajar dentro de la plataforma Stratio utilizando los módulos Rocket e Intelligence.
- Aplicar PySpark en el contexto de ingestión, transformación y análisis de datos.
- Utilizar bucles y lógica condicional para controlar flujos de trabajo y tareas de ingeniería de características.
- Crear y gestionar funciones definidas por el usuario (UDF) para operaciones de datos reutilizables en PySpark.
Formato del curso
- Lección interactiva y discusión.
- Numerosos ejercicios y prácticas.
- Implementación práctica en un entorno de laboratorio en vivo.
Opciones de personalización del curso
- Para solicitar una formación personalizada para este curso, póngase en contacto con nosotros para coordinarlo.