Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Introducción a los modelos multimodales de Mistral
- Visión general de Mistral Medium y sus capacidades multimodales.
- Modelos de OCR/documentos y casos de uso.
- Integración con ecosistemas de código abierto.
Pipelines de OCR y visión
- Fundamentos de OCR con modelos Mistral.
- Preprocesamiento de imágenes y documentos escaneados.
- Extracción de texto estructurado a partir de imágenes.
Comprensión de documentos
- Diseño de pipelines de PLN para documentos.
- Reconocimiento de entidades, resumen y clasificación.
- Vinculación multimodal entre datos de texto y visión.
Búsqueda y aplicaciones de conocimiento
- Sistemas de búsqueda por texto y visión.
- Desarrollo de búsqueda semántica con salidas de OCR.
- Repositorios de documentos empresariales.
Aplicaciones asistivas e interactivas
- Diseño de interfaz de usuario para asistentes multimodales.
- Aplicaciones de accesibilidad (por ejemplo, conversión de visión a texto).
- Herramientas de productividad del mundo real.
Rendimiento y optimización
- Escalado de flujos de trabajo multimodales.
- Ajuste del rendimiento de inferencia.
- Evaluación de las compensaciones entre precisión y eficiencia.
Casos de estudio y futuras direcciones
- Aplicaciones industriales de la IA multimodal.
- Tendencias de investigación en OCR e IA para documentos.
- Consideraciones de IA responsable en tareas de texto y visión.
Resumen y siguientes pasos
Requerimientos
- Comprensión de los conceptos de procesamiento de lenguaje natural.
- Experiencia con Python y marcos de aprendizaje automático.
- Familiaridad con los fundamentos de la visión por computadora.
Audiencia objetivo
- Equipos de producto.
- Investigadores de aprendizaje automático.
- Ingenieros de aprendizaje automático aplicado.
14 Horas