Prenez contact avec nous
 Durée 21 heures

Plan du cours

Introduction à l'IA multimodale et à Ollama

  • Aperçu de l'apprentissage multimodal
  • Défis clés dans l'intégration vision-langage
  • Capacités et architecture d'Ollama

Mise en place de l'environnement Ollama

  • Installation et configuration d'Ollama
  • Travail avec le déploiement local des modèles
  • Intégration d'Ollama avec Python et Jupyter

Travail avec des entrées multimodales

  • Intégration texte et image
  • Incorporation d'audio et de données structurées
  • Conception de pipelines de prétraitement

Applications de compréhension de documents

  • Extraction d'informations structurées depuis des PDF et des images
  • Combinaison de l'OCR avec les modèles de langage
  • Construction de flux de travail d'analyse de documents intelligents

Réponse à des questions visuelles (VQA - Visual Question Answering)

  • Mise en place des jeux de données et des benchmarks VQA
  • Entraînement et évaluation des modèles multimodaux
  • Construction d'applications VQA interactives

Conception d'agents multimodaux

  • Principes de conception d'agents avec raisonnement multimodal
  • Combinaison de la perception, du langage et de l'action
  • Déploiement d'agents pour des cas d'usage réels

Intégration et optimisation avancées

  • Affinage (fine-tuning) de modèles multimodaux avec Ollama
  • Optimisation des performances d'inférence
  • Considérations d'extensibilité et de déploiement

Synthèse et étapes suivantes

Pré requis

  • Maîtrise solide des concepts d'apprentissage automatique (machine learning).
  • Expérience avec des cadres de deep learning tels que PyTorch ou TensorFlow.
  • Familiarité avec le traitement du langage naturel et la vision par ordinateur.

Public cible

  • Ingénieurs en apprentissage automatique.
  • Chercheurs en intelligence artificielle.
  • Développeurs de produits intégrant des flux de travail vision et texte.

Nombre de participants


Prix par participant

Cours à venir

Catégories Similaires