Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Duración 21 horas
Temario del curso
Introducción a la IA multimodal y Ollama
- Vista general del aprendizaje multimodal.
- Desafíos clave en la integración visión-lenguaje.
- Capacidades y arquitectura de Ollama.
Configuración del entorno de Ollama
- Instalación y configuración de Ollama.
- Trabajo con la implementación de modelos locales.
- Integración de Ollama con Python y Jupyter.
Trabajo con entradas multimodales
- Integración de texto e imagen.
- Incorporación de audio y datos estructurados.
- Diseño de pipelines de preprocesamiento.
Aplicaciones de comprensión de documentos
- Extracción de información estructurada de PDFs e imágenes.
- Combinación de OCR con modelos de lenguaje.
- Construcción de flujos de trabajo de análisis de documentos inteligentes.
Respuesta a preguntas visuales (VQA)
- Configuración de conjuntos de datos y benchmarks de VQA.
- Entrenamiento y evaluación de modelos multimodales.
- Construcción de aplicaciones de VQA interactivas.
Diseño de agentes multimodales
- Principios del diseño de agentes con razonamiento multimodal.
- Combinación de percepción, lenguaje y acción.
- Despliegue de agentes para casos de uso en el mundo real.
Integración y optimización avanzadas
- Ajuste fino de modelos multimodales con Ollama.
- Optimización del rendimiento de inferencia.
- Consideraciones sobre escalabilidad e implementación.
Resumen y próximos pasos
Requerimientos
- Sólido conocimiento de conceptos de aprendizaje automático (machine learning).
- Experiencia con frameworks de aprendizaje profundo como PyTorch o TensorFlow.
- Conocimiento de procesamiento de lenguaje natural y visión por computadora.
Audiencia
- Ingenieros de aprendizaje automático.
- Investigadores de IA.
- Desarrolladores de productos que integren flujos de trabajo de visión y texto.