Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Introducción a EXO y Clustering de IA Local
- Visión general del framework EXO y el ecosistema exo-explore
- Comparación entre inferencia centralizada en la nube e inferencia local distribuida
- Arquitectura: descubrimiento de dispositivos con libp2p, backend MLX, dashboard y capas API
- Requisitos de hardware: Apple Silicon (M3 Ultra, M4 Pro/Max), Thunderbolt 5, almacenamiento compartido
Instalación de EXO en macOS
- Configuración de Xcode, Metal ToolChain y prerequisitos de macOS
- Instalación de uv, Node.js, herramienta Rust nightly
- Instalación del fork macmon fijado para monitoreo de Apple Silicon
- Clonar el repositorio y construir el dashboard con npm
- Ejecutar EXO desde el código fuente y verificar el dashboard en localhost:52415
Instalación de EXO en Linux
- Instalación de dependencias mediante apt o Homebrew en Linux
- Configuración de uv, Node.js 18+ y Rust nightly
- Construcción del dashboard y ejecución de EXO en modo solo CPU
- Estructura de directorios: rutas XDG Base Directory para configuración, datos, caché y registros
Descubrimiento Automático de Dispositivos y Formación de Clusters
- Comprensión del auto-descubrimiento basado en libp2p a través de redes locales
- Configuración de nombres de grupo personalizados con EXO_LIBP2P_NAMESPACE para aislamiento del cluster
- Verificación de la membresía del nodo en la vista de cluster del dashboard
- Gestión de fallos de descubrimiento y problemas de segmentación de red
Habilitación de RDMA sobre Thunderbolt 5
- Arquitectura de RDMA y la afirmación de reducción del 99 por ciento en la latencia
- Habilitar RDMA en el modo de recuperación de macOS con rdma_ctl
- Requisitos de cableado y restricciones de topología de puertos en Mac Studio
- Igualación de versiones de macOS en todos los nodos del cluster
- Solución de problemas de descubrimiento RDMA y configuración DHCP
Despliegue de Modelos Frontier
- Uso del dashboard para cargar y fragmentar modelos DeepSeek v3.1, Qwen3-235B y familia Llama
- Visualización de asignaciones de instancias con el punto final /instance/previews API
- Creación de instancias de modelo con fragmentación por pipeline o paralelismo de tensor
- Configuración de tarjetas de modelo personalizadas desde el hub HuggingFace
Monitoreo y Solución de Problemas
- Lectura de registros EXO y comprensión del rastro distribuido
- Interpretación de la salud del cluster en la vista de cluster del dashboard
- Diagnóstico de fallos en nodos workers y comportamiento de reconexión
- Uso de EXO_TRACING_ENABLED para análisis de cuellos de botella de rendimiento
Mantenimiento y Actualización del Cluster
- Actualización de binarios EXO y procedimientos de reconstrucción del dashboard
- Migración de cachés de modelos y gestión de modelos pre-descargados sobre NFS
- Eliminación ordenada de nodos y reequilibrio de cargas de trabajo
Requerimientos
- Comprensión de los fundamentos de redes (IP, subnetting, firewalls)
- Experiencia con administración de línea de comandos en macOS o Linux
- Familiaridad con la gestión de paquetes Python (pip/uv) y herramientas Node.js
Audiencia
- Administradores de sistemas
- Ingenieros de DevOps
- Arquitectos de infraestructura de IA responsables del despliegue on-premise de LLMs
21 Horas