Ponte en Contacto

Temario del curso

Fundamentos de Tencent Hunyuan para Producción

  • Visión general de los escenarios de servicio de modelos Tencent Hunyuan
  • Características de producción de modelos grandes y MoE
  • Bottlenecks comunes de latencia, capacidad de procesamiento y costos
  • Definición de objetivos de nivel de servicio para cargas de trabajo de inferencia

Arquitectura de Implementación y Flujo de Servicio

  • Componentes principales de una pila de inferencia en producción
  • Elegir entre modelos de implementación en contenedores, locales y en la nube
  • Fundamentos de carga de modelos, enrutamiento de solicitudes y asignación de GPU
  • Diseño para confiabilidad y simplicidad operativa

Optimización de Latencia en la Práctica

  • Uso de motores de inferencia optimizados como TensorRT, donde corresponda
  • Conceptos de KV-cache y ajuste práctico de caché
  • Reducción de los tiempos de inicio, calentamiento (warmup) y respuesta
  • Medición del tiempo hasta el primer token y la velocidad de generación de tokens

Capacidad de Procesamiento, Agrupamiento y Eficiencia de GPU

  • Estrategias de agrupamiento continuo y agrupamiento de solicitudes
  • Gestión de la concurrencia y el comportamiento de colas
  • Mejora de la utilización de GPU sin perjudicar la experiencia del usuario
  • Gestión de solicitudes de contexto largo y cargas de trabajo mixtas

Cuantización y Control de Costos

  • Por qué es importante la cuantización para el servicio en producción
  • Compensaciones prácticas de FP16, INT8 y otras opciones comunes de precisión
  • Equilibrio entre calidad del modelo, latencia y costo de infraestructura
  • Creación de una lista de comprobación simple para la optimización de costos

Operaciones, Monitoreo y Revisión de Listo para Producción

  • Disparadores de autoescalado para servicios de inferencia
  • Monitoreo de latencia, capacidad de procesamiento, uso de caché y estado de la GPU
  • Fundamentos de registro (logging), alertas y respuesta a incidentes
  • Revisión de una implementación de referencia y creación de un plan de mejora

Requerimientos

  • Comprensión básica de la implementación y los flujos de trabajo de inferencia de modelos de lenguaje grande.
  • Experiencia con contenedores, infraestructura en la nube o local, y servicios basados en API.
  • Conocimientos prácticos de Python o tareas de ingeniería de sistemas.

Audiencia

  • Ingenieros de ML que implementan LLMs en producción.
  • Ingenieros de plataforma responsables de servicios de inferencia basados en GPU.
  • Arquitectos de soluciones que diseñan plataformas escalables de servicio de IA.
 14 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas