Prenez contact avec nous

Plan du cours

Introduction aux modèles multimodaux Mistral

  • Présentation de Mistral Medium et de ses capacités multimodales
  • Modèles OCR/document et cas d'usage
  • Intégration avec les écosystèmes open source

Pipelines OCR et vision

  • Fondamentaux de l'OCR avec les modèles Mistral
  • Prétraitement des images et des documents scannés
  • Extraction de texte structuré à partir d'images

Compréhension documentaire

  • Conception de pipelines NLP pour les documents
  • Reconnaissance d'entités, résumés et classification
  • Lien intermodal entre données textuelles et visuelles

Applications de recherche et de connaissance

  • Systèmes de recherche par vision-texte
  • Création de recherche sémantique à partir des sorties OCR
  • Dépôts documentaires d'entreprise

Applications assistives et interactives

  • Conception d'interfaces utilisateur pour assistants multimodaux
  • Applications d'accessibilité (ex. : conversion vision en texte)
  • Outils de productivité du monde réel

Performance et optimisation

  • Mise à l'échelle des pipelines multimodaux
  • Réglage de la performance d'inférence
  • Évaluation des compromis entre précision et efficacité

Études de cas et perspectives futures

  • Applications industrielles de l'IA multimodale
  • Tendances de la recherche en OCR et IA documentaire
  • Considérations relatives à l'IA responsable dans les tâches vision-texte

Synthèse et prochaines étapes

Pré requis

  • Compréhension des concepts du traitement du langage naturel (NLP)
  • Expérience avec Python et les frameworks de ML
  • Familiarité avec les bases de la vision par ordinateur

Public cible

  • Équipes produit
  • Chercheurs en ML
  • Ingénieurs ML appliqués
 14 Heures

Nombre de participants


Prix par participant

Cours à venir

Catégories Similaires