Contacta con nosotros

Temario del curso

Cada sesión dura 2 horas

Día-1: Sesión -1: Visión general del negocio sobre por qué la Inteligencia de Negocios de Big Data en el Gobierno

  • Estudios de casos del NIH, DoE
  • Tasa de adopción de Big Data en agencias gubernamentales y cómo están alineando sus operaciones futuras con base en Analítica Predictiva de Big Data
  • Áreas de aplicación a gran escala en DoD, NSA, IRS, USDA, etc.
  • Interfaz de Big Data con datos heredados
  • Comprensión básica de las tecnologías habilitadoras en analítica predictiva
  • Integración de datos y visualización en paneles de control
  • Gestión de fraude
  • Generación de reglas comerciales/detección de fraude
  • Detección de amenazas y perfilamiento
  • Análisis costo-beneficio para la implementación de Big Data

Día-1: Sesión-2 : Introducción a Big Data-1

  • Características principales del Big Data: volumen, variedad, velocidad y veracidad. Arquitectura MPP para volumen.
  • Muecos de datos – esquema estático, conjunto de datos que evoluciona lentamente
  • Bases de datos MPP como Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
  • Soluciones basadas en Hadoop – sin condiciones sobre la estructura del conjunto de datos.
  • Patrón típico : HDFS, MapReduce (crunch), recuperación desde HDFS
  • Lote: adecuado para analítica/no interactivo
  • Volumen : CEP (Procesamiento de Eventos Complejos) como datos en streaming
  • Opciones típicas – productos CEP (ej. Infostreams, Apama, MarkLogic, etc)
  • Menos listos para producción – Storm/S4
  • Bases de datos NoSQL – (columnar y clave-valor): mejor adecuado como complemento analítico al almacén de datos/base de datos

Día-1 : Sesión -3 : Introducción a Big Data-2

Soluciones NoSQL

  • Almacén KV - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • Almacén KV - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • Almacén KV (Jerárquico) - GT.m, Cache
  • Almacén KV (Ordenado) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • Caché KV - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Almacén de tuplas - Gigaspaces, Coord, Apache River
  • Base de datos de objetos - ZopeDB, DB40, Shoal
  • Almacén de documentos - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Almacén columnar ancho - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Variaciones de datos: Introducción a los problemas de limpieza de datos en Big Data

  • RDBMS – estructura/esquema estático, no promueve un entorno ágil y exploratorio.
  • NoSQL – semi estructurado, suficiente estructura para almacenar datos sin un esquema exacto previo al almacenamiento
  • Problemas de limpieza de datos

Día-1 : Sesión-4 : Introducción a Big Data-3 : Hadoop

  • ¿Cuándo seleccionar Hadoop?
  • ESTRUCTURADO - Los almacenes/bases de datos empresariales pueden almacenar datos masivos (a un costo) pero imponen estructura (no es bueno para la exploración activa)
  • Datos SEMI ESTRUCTURADOS – difícil de manejar con soluciones tradicionales (DW/DB)
  • Almacenamiento de datos = ESEFUERZO ENORME y estático incluso después de la implementación
  • Para variedad y volumen de datos, procesados en hardware comercial – HADOOP
  • Hardware comercial necesario para crear un clúster Hadoop

Introducción a Map Reduce /HDFS

  • MapReduce – distribuir el procesamiento entre múltiples servidores
  • HDFS – hacer los datos disponibles localmente para el proceso de computación (con redundancia)
  • Datos – pueden ser no estructurados/sin esquema (a diferencia de RDBMS)
  • Responsabilidad del desarrollador de dar sentido a los datos
  • Programar MapReduce = trabajar con Java (pros/contras), cargar manualmente los datos en HDFS

Día-2: Sesión-1: Ecosistema de Big Data-Construyendo Big Data ETL: universo de herramientas de Big Data-cuál usar y cuándo?

  • Hadoop vs. Otras soluciones NoSQL
  • Para acceso interactivo y aleatorio a los datos
  • Hbase (base de datos orientada a columnas) sobre Hadoop
  • Acceso aleatorio a los datos pero con restricciones impuestas (max 1 PB)
  • No bueno para analítica ad-hoc, bueno para registro, conteo, series temporales
  • Sqoop - Importar desde bases de datos a Hive o HDFS (acceso JDBC/ODBC)
  • Flume – transmitir datos (ej. datos de registro) a HDFS

Día-2: Sesión-2: Sistema de gestión de Big Data

  • Componentes móviles, nodos de computación inician/fallan : ZooKeeper - Para servicios de configuración/coordinación/nombrado
  • Pipeline/flujo de trabajo complejo: Oozie – gestionar flujo de trabajo, dependencias, cadena daisy
  • Despliegue, configuración, gestión de clústeres, actualización, etc. (admin del sistema) : Ambari
  • En la nube : Whirr

Día-2: Sesión-3: Analítica predictiva en Inteligencia de Negocios -1: Técnicas fundamentales y BI basado en aprendizaje automático:

  • Introducción al aprendizaje automático
  • Aprendizaje de técnicas de clasificación
  • Predicción Bayesiana-preparación del archivo de entrenamiento
  • Máquina de soporte vectorial
  • KNN p-Tree Álgebra y minería vertical
  • Red neuronal
  • Problema de gran variable en Big Data - Bosque aleatorio (RF)
  • Problema de automatización en Big Data – RF de conjunto multimodal
  • Automatización a través de Soft10-M
  • Herramienta de análisis de texto-Treeminer
  • Aprendizaje ágil
  • Aprendizaje basado en agentes
  • Aprendizaje distribuido
  • Introducción a herramientas de código abierto para analítica predictiva : R, Rapidminer, Mahout

Día-2: Sesión-4 Ecosistema de analítica predictiva-2: Problemas comunes de analítica predictiva en el gobierno.

  • Analítica insight
  • Analítica visualización
  • Analítica predictiva estructurada
  • Analítica predictiva no estructurada
  • Perfilamiento de amenazas/fraudstar/proveedores
  • Motor de recomendación
  • Detección de patrones
  • Detección de reglas/escenarios –falla, fraude, optimización
  • Detección de causa raíz
  • Análisis de sentimiento
  • Analítica CRM
  • Analítica de red
  • Análisis de texto
  • Revisión asistida por tecnología
  • Analítica de fraude
  • Analítica en tiempo real

Día-3 : Sesión-1 : Analítica en Tiempo Real y Escalable sobre Hadoop

  • ¿Por qué fallan los algoritmos analíticos comunes en Hadoop/HDFS?
  • Apache Hama- para computación distribuida sincronizada por lotes
  • Apache SPARK- para computación de clústeres para analítica en tiempo real
  • CMU Graphics Lab2- Enfoque asíncrono basado en grafos para computación distribuida
  • Enfoque basado en KNN p-Algebra desde Treeminer para reducir el costo operativo del hardware

Día-3: Sesión-2: Herramientas para eDiscovery y Forensia

  • eDiscovery sobre Big Data vs. Datos heredados – una comparación de costos y rendimiento
  • Codificación predictiva y revisión asistida por tecnología (TAR)
  • Demostración en vivo de un producto TAR (vMiner) para comprender cómo funciona TAR para un descubrimiento más rápido
  • Indexación más rápida a través de HDFS – velocidad de los datos
  • NLP o procesamiento del lenguaje natural – varias técnicas y productos de código abierto
  • eDiscovery en idiomas extranjeros-tecnología para el procesamiento de idiomas extranjeros

Día-3 : Sesión 3: Big Data BI para Ciberseguridad – Entendiendo la visión completa de 360 grados desde la recopilación rápida de datos hasta la identificación de amenazas

  • Comprensión de los conceptos básicos de analítica de seguridad-superficie de ataque, mala configuración de seguridad, defensas de host
  • Infraestructura de red/gran tubería de datos/ETL de respuesta para analítica en tiempo real
  • Prescriptivo vs. predictivo – reglas fijas basadas en reglas versus descubrimiento automático de reglas de amenaza desde metadatos

Día-3: Sesión 4: Big Data en USDA : Aplicación en Agricultura

  • Introducción a IoT (Internet de las Cosas) para la agricultura-sensores basados en Big Data y control
  • Introducción a la imagen satelital y su aplicación en la agricultura
  • Integración de datos de sensores e imágenes para fertilidad del suelo, recomendaciones de cultivo y pronósticos
  • Seguro agrícola y Big Data
  • Pronóstico de pérdida de cultivos

Día-4 : Sesión-1: Prevención de fraude BI desde Big Data en el gobierno-Analítica de fraude:

  • Clasificación básica de la analítica de fraude- basada en reglas vs. analítica predictiva
  • Aprendizaje automático supervisado vs. no supervisado para la detección de patrones de fraude
  • Fraude del proveedor/sobreprecio por proyectos
  • Fraude en Medicare y Medicaid-técnicas de detección de fraude para el procesamiento de reclamaciones
  • Fraudes en reembolsos de viaje
  • Fraudes en devoluciones del IRS
  • Se proporcionarán estudios de casos y demostraciones en vivo donde los datos estén disponibles.

Día-4 : Sesión-2: Analítica de Redes Sociales-Recolección e inteligencia y análisis

  • API ETL de Big Data para extraer datos de redes sociales
  • Texto, imagen, metadatos y video
  • Análisis de sentimiento desde la fuente de noticias de redes sociales
  • Filtrado contextual y no contextual de la fuente de noticias de redes sociales
  • Panel de control de Redes Sociales para integrar diversas redes sociales
  • Perfilamiento automatizado de perfiles de redes sociales
  • Demostración en vivo de cada analítica se realizará a través de la herramienta Treeminer.

Día-4 : Sesión-3: Analítica de Big Data en procesamiento de imágenes y flujos de video

  • Técnicas de almacenamiento de imágenes en Big Data-Solución de almacenamiento para datos que exceden petabytes
  • LTFS y LTO
  • GPFS-LTFS (Solución de almacenamiento en capas para datos de imagen grandes)
  • Fundamentos del análisis de imágenes
  • Reconocimiento de objetos
  • Segmentación de imágenes
  • Rastreo de movimiento
  • Reconstrucción de imágenes 3D

Día-4: Sesión-4: Aplicaciones de Big Data en NIH:

  • Áreas emergentes de la bioinformática
  • Metagenómica y problemas de minería de Big Data
  • Analítica predictiva de Big Data para Farmacogenómica, Metabolómica y Proteómica
  • Big Data en el proceso genómico posterior
  • Aplicación de la analítica predictiva de Big data en salud pública

Panel de control de Big Data para acceso rápido a datos diversos y visualización :

  • Integración de la plataforma de aplicaciones existente con el Panel de control de Big Data
  • Gestión de Big Data
  • Caso de Estudio del Panel de control de Big Data: Tableau y Pentaho
  • Uso de aplicaciones de Big Data para impulsar servicios basados en ubicación en el gobierno.
  • Sistema de rastreo y gestión

Día-5 : Sesión-1: Cómo justificar la implementación de Inteligencia de Negocios de Big Data dentro de una organización:

  • Definición del ROI para la implementación de Big Data
  • Estudios de casos para ahorrar tiempo de analistas en la recopilación y preparación de datos –aumento en la ganancia de productividad
  • Estudios de casos de ganancia de ingresos al ahorrar el costo de licencias de bases de datos
  • Ganancia de ingresos desde servicios basados en ubicación
  • Ahorros por prevención de fraude
  • Un enfoque integrado de hojas de cálculo para calcular el gasto aprox. vs. Ganancia/ahorro de ingresos desde la implementación de Big Data.

Día-5 : Sesión-2: Procedimiento paso a paso para reemplazar sistemas de datos heredados por sistemas de Big Data:

  • Comprensión del mapa de ruta práctico de migración de Big Data
  • ¿Qué información importante se necesita antes de arquitecturar una implementación de Big Data?
  • ¿Cuáles son las diferentes formas de calcular volumen, velocidad, variedad y veracidad de los datos?
  • ¿Cómo estimar el crecimiento de datos?
  • Estudios de casos

Día-5: Sesión 4: Revisión de proveedores de Big Data y revisión de sus productos. Sesión de preguntas y respuestas:

  • Accenture
  • APTEAN (anteriormente CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (anteriormente 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (Parte de EMC)

Requerimientos

  • Conocimiento básico de las operaciones comerciales y sistemas de datos en el gobierno en su dominio
  • Comprensión básica de SQL/Oracle o bases de datos relacionales
  • Comprensión básica de Estadísticas (a nivel de hojas de cálculo)
 35 Horas

Número de participantes


Precio por participante

Reseñas (1)

Próximos cursos

Categorías Relacionadas