Contacta con nosotros

Temario del curso

Introducción a los modelos visio-lingüísticos

  • Visión general de los VLM y su papel en la IA multimodal.
  • Arquitecturas populares: CLIP, Flamingo, BLIP, etc.
  • Casos de uso: búsqueda, generación de descripciones, sistemas autónomos, análisis de contenido.

Preparación del entorno para el ajuste fino

  • Configuración de OpenCLIP y otras bibliotecas de VLM.
  • Formatos de datos para pares de imagen-texto.
  • Pipelines de procesamiento previo para entradas visuales y de lenguaje.

Ajuste fino de CLIP y modelos similares

  • Pérdida de contraste y espacios de incrustación conjuntos (joint embedding).
  • Práctica: ajuste fino de CLIP en conjuntos de datos personalizados.
  • Gestión de datos específicos del dominio y multilingües.

Técnicas avanzadas de ajuste fino

  • Uso de LoRA y métodos basados en adaptadores para mayor eficiencia.
  • Ajuste de prompts (prompt tuning) e inyección visual de prompts.
  • Compensación entre evaluación con cero ejemplos (zero-shot) y evaluación tras el ajuste fino.

Evaluación y pruebas comparativas

  • Métricas para VLM: precisión en la recuperación, BLEU, CIDEr, tasa de aciertos (recall).
  • Diagnósticos de alineación visio-textual.
  • Visualización de espacios de incrustación y clasificaciones erróneas.

Implementación y uso en aplicaciones reales

  • Exportación de modelos para inferencia (TorchScript, ONNX).
  • Integración de VLM en pipelines o APIs.
  • Consideraciones sobre recursos y escalado de modelos.

Casos de estudio y escenarios aplicados

  • Análisis de medios y moderación de contenido.
  • Búsqueda y recuperación en comercio electrónico y bibliotecas digitales.
  • Interacción multimodal en robótica y sistemas autónomos.

Resumen y próximos pasos

Requerimientos

  • Comprensión del aprendizaje profundo aplicado a la visión por computadora y el procesamiento del lenguaje natural (NLP).
  • Experiencia con PyTorch y modelos basados en transformadores.
  • Habilidades en arquitecturas de modelos multimodales.

Público objetivo

  • Ingenieros de visión por computadora.
  • Desarrolladores de IA.
 14 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas