Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Duración 14 horas
Temario del curso
Fundamentos de Tencent Hunyuan para Producción
- Visión general de los escenarios de servicio de modelos Tencent Hunyuan
- Características de producción de modelos grandes y MoE
- Bottlenecks comunes de latencia, capacidad de procesamiento y costos
- Definición de objetivos de nivel de servicio para cargas de trabajo de inferencia
Arquitectura de Implementación y Flujo de Servicio
- Componentes principales de una pila de inferencia en producción
- Elegir entre modelos de implementación en contenedores, locales y en la nube
- Fundamentos de carga de modelos, enrutamiento de solicitudes y asignación de GPU
- Diseño para confiabilidad y simplicidad operativa
Optimización de Latencia en la Práctica
- Uso de motores de inferencia optimizados como TensorRT, donde corresponda
- Conceptos de KV-cache y ajuste práctico de caché
- Reducción de los tiempos de inicio, calentamiento (warmup) y respuesta
- Medición del tiempo hasta el primer token y la velocidad de generación de tokens
Capacidad de Procesamiento, Agrupamiento y Eficiencia de GPU
- Estrategias de agrupamiento continuo y agrupamiento de solicitudes
- Gestión de la concurrencia y el comportamiento de colas
- Mejora de la utilización de GPU sin perjudicar la experiencia del usuario
- Gestión de solicitudes de contexto largo y cargas de trabajo mixtas
Cuantización y Control de Costos
- Por qué es importante la cuantización para el servicio en producción
- Compensaciones prácticas de FP16, INT8 y otras opciones comunes de precisión
- Equilibrio entre calidad del modelo, latencia y costo de infraestructura
- Creación de una lista de comprobación simple para la optimización de costos
Operaciones, Monitoreo y Revisión de Listo para Producción
- Disparadores de autoescalado para servicios de inferencia
- Monitoreo de latencia, capacidad de procesamiento, uso de caché y estado de la GPU
- Fundamentos de registro (logging), alertas y respuesta a incidentes
- Revisión de una implementación de referencia y creación de un plan de mejora
Requerimientos
- Comprensión básica de la implementación y los flujos de trabajo de inferencia de modelos de lenguaje grande.
- Experiencia con contenedores, infraestructura en la nube o local, y servicios basados en API.
- Conocimientos prácticos de Python o tareas de ingeniería de sistemas.
Audiencia
- Ingenieros de ML que implementan LLMs en producción.
- Ingenieros de plataforma responsables de servicios de inferencia basados en GPU.
- Arquitectos de soluciones que diseñan plataformas escalables de servicio de IA.