Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
El panorama de la observabilidad con IA
- De paneles de control a conversaciones: el cambio hacia una observabilidad aumentada por IA.
- Capacidades de LLM relevantes para observabilidad: resumen, razonamiento y coincidencia de patrones.
- Patrones de arquitectura: integrar IA en las pilas de observabilidad existentes.
Consulta de telemetría en lenguaje natural
- Texto a PromQL: traducir lenguaje natural a consultas de monitoreo.
- Consultas en NL para almacenes de registros de Elasticsearch, OpenSearch y Loki.
- Generación de SQL a partir de lenguaje natural para telemetría estructurada.
- Creación de un agente asistente de consultas con uso de herramientas y conciencia contextual.
Análisis de registros potenciado por LLM
- Parseo y estructuración automatizada de registros con LLM.
- Detección de anomalías en flujos de registros mediante similitud de incrustaciones (embeddings).
- Agrupación de registros y descubrimiento de patrones a escala.
- Generación de explicaciones legibles por humanos a partir de secuencias de registros crudas.
Alertas inteligentes y enriquecimiento de incidentes
- Correlación y deduplicación de alertas con comprensión semántica.
- Recolección automatizada de contexto de incidentes a partir de runbooks, incidentes anteriores y documentación.
- Ruteo inteligente de alertas basado en la comprensión del contenido y la experiencia del equipo.
- Reducción de la fatiga de alertas mediante la reducción de ruido impulsada por IA.
Análisis de causa raíz asistido por IA
- Generación de hipótesis a partir de la correlación de telemetría multifuente.
- Cadena de evidencias: conectar síntomas entre métricas, registros y trazas.
- Solución guiada de problemas con sesiones interactivas de diagnóstico por IA.
- Creación de un agente de análisis de causa raíz con investigación progresiva.
Respuesta automatizada a incidentes y comunicación
- Generación de resúmenes de incidentes y actualizaciones de estado a partir de datos telemétricos.
- Elaboración automatizada de post-mortem con reconstrucción de la línea de tiempo.
- Comunicación con grupos de interés adaptada a audiencias técnicas y ejecutivas.
- Sugerencia de runbooks y recomendaciones de remediación automatizada.
ML para observabilidad
- Pronóstico de series temporales para planificación de capacidad y predicción de anomalías.
- Modelos fundamentales para detección de anomalías sin entrenamiento previo (zero-shot) en métricas.
- Mapeo de dependencias de servicios y descubrimiento de topología basado en incrustaciones (embeddings).
- Entrenamiento e implementación de modelos ligeros de ML junto a las canalizaciones de observabilidad.
Implementación en producción y ética
- Consideraciones de latencia y costos para la observabilidad con IA en tiempo real.
- Privacidad de los datos: asegurar que los LLM no filtren telemetría sensible.
- Vigilancia humana: cuándo el diagnóstico por IA requiere validación del operador.
- Medición del impacto: MTTD, MTTR y métricas de la experiencia de guardia (on-call).
Requerimientos
- Experiencia con herramientas de observabilidad como Prometheus, Grafana, Datadog u OpenTelemetry.
- Conocimiento de los conceptos de gestión de registros y métricas.
- Conocimientos básicos de scripting en Python para procesamiento de datos.
Público objetivo
- Ingenieros de SRE y observabilidad que adoptan herramientas mejoradas con IA.
- Ingenieros de plataforma que desarrollan canalizaciones de monitoreo de nueva generación.
- Líderes de DevOps que evalúan la integración de LLM en flujos de trabajo de incidentes.
14 Horas