Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Plan du cours
Introduction aux modèles multimodaux Mistral
- Présentation de Mistral Medium et de ses capacités multimodales
- Modèles OCR/document et cas d'usage
- Intégration avec les écosystèmes open source
Pipelines OCR et vision
- Fondamentaux de l'OCR avec les modèles Mistral
- Prétraitement des images et des documents scannés
- Extraction de texte structuré à partir d'images
Compréhension documentaire
- Conception de pipelines NLP pour les documents
- Reconnaissance d'entités, résumés et classification
- Lien intermodal entre données textuelles et visuelles
Applications de recherche et de connaissance
- Systèmes de recherche par vision-texte
- Création de recherche sémantique à partir des sorties OCR
- Dépôts documentaires d'entreprise
Applications assistives et interactives
- Conception d'interfaces utilisateur pour assistants multimodaux
- Applications d'accessibilité (ex. : conversion vision en texte)
- Outils de productivité du monde réel
Performance et optimisation
- Mise à l'échelle des pipelines multimodaux
- Réglage de la performance d'inférence
- Évaluation des compromis entre précision et efficacité
Études de cas et perspectives futures
- Applications industrielles de l'IA multimodale
- Tendances de la recherche en OCR et IA documentaire
- Considérations relatives à l'IA responsable dans les tâches vision-texte
Synthèse et prochaines étapes
Pré requis
- Compréhension des concepts du traitement du langage naturel (NLP)
- Expérience avec Python et les frameworks de ML
- Familiarité avec les bases de la vision par ordinateur
Public cible
- Équipes produit
- Chercheurs en ML
- Ingénieurs ML appliqués
14 Heures