Contacta con nosotros

Temario del curso

Infraestructura como Código para EXO

  • Visión general de patrones de despliegue de EXO: clústeres de nodo único, multinodo y RDMA
  • Automatización de la instalación de dependencias (Xcode, uv, Node.js, Rust) con gestión de configuraciones
  • Uso de flakes de Nix para construcciones reproducibles de EXO y entornos de desarrollo
  • Escritura de playbooks de Ansible o scripts de shell para el aprovisionamiento no supervisado del clúster

Construcciones Reproducibles e Integración con CI

  • Fijación de dependencias y construcción del panel de control en pipelines de CI
  • Ejecución de pruebas básicas (smoke tests) de EXO en corredores de GitHub Actions o GitLab CI
  • Creación de imágenes base y flujos de trabajo de reversión basados en instantáneas para máquinas virtuales de macOS y Linux
  • Versionado de tarjetas de modelo personalizadas junto con el código de la aplicación

Descubrimiento del Clúster y Automatización de Redes

  • Configuración de mDNS y DNS estático para un descubrimiento confiable de nodos libp2p
  • Automatización de la creación de perfiles de red y gestión de puentes Thunderbolt en macOS
  • Uso de espacios de nombres personalizados (EXO_LIBP2P_NAMESPACE) para separar clústeres de desarrollo, preproducción y producción
  • Reglas de firewall y segmentación de red para entornos multitenant

Gestión del Ciclo de Vida del Modelo y Almacenamiento

  • Diseño de estrategias para EXO_MODELS_DIRS y EXO_MODELS_READ_ONLY_DIRS
  • Montaje de comparticiones NFS o SAN como repositorios de solo lectura para un aprovisionamiento rápido
  • Recolección de basura de cachés obsoletos y políticas de retención de pesos versionados
  • Automatización de la descarga previa de modelos y verificaciones de salud antes de actualizaciones graduales

Monitoreo y Alertas

  • Envío de registros de EXO a sistemas de registro centralizados (ELK, Loki o Splunk)
  • Construcción de paneles de control Grafana a partir del output EXO_TRACING_ENABLED
  • Alertas sobre cambios en la membresía del clúster, eventos OOM y picos de latencia de inferencia
  • Correlación de telemetría de hardware macmon con regresiones en el rendimiento del modelo

Actualización, Reversión y Recuperación ante Desastres

  • Preparación (staging) de actualizaciones de binarios EXO en un nodo canario antes del despliegue a toda la flota
  • Reversión a nivel de modelo: cambio entre versiones cuantizadas sin volver a descargar
  • Copia de seguridad y restauración del estado del clúster, espacios de nombres personalizados y pesos en caché
  • Documentación de procedimientos de recuperación para escenarios de reconstrucción total del clúster

Acondicionamiento de Seguridad y Cumplimiento

  • Aplicación de TLS en la capa del proxy inverso (nginx, traefik) para el panel de control y la API
  • Implementación de limitación de velocidad de API y listas blancas de IP para los puntos finales de EXO
  • Aislamiento de clústeres con VLANs y políticas de red de confianza cero
  • Auditoría del acceso y mantenimiento de un inventario de modelos desplegados y sus versiones

Requerimientos

  • Experiencia con prácticas de DevOps (CI/CD, IaC, orquestación de contenedores)
  • Conocimiento de administración de sistemas y gestión de paquetes en macOS o Linux
  • Comprensión de conceptos de redes, DNS y almacenamiento

Público Objetivo

  • Ingenieros de DevOps
  • Arquitectos de infraestructura
  • SREs responsables de cargas de trabajo de IA on-premise
 21 Horas

Número de participantes


Precio por participante

Reseñas (2)

Próximos cursos

Categorías Relacionadas