Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Durée 21 heures
Plan du cours
Introduction à l'IA multimodale et à Ollama
- Aperçu de l'apprentissage multimodal
- Défis clés dans l'intégration vision-langage
- Capacités et architecture d'Ollama
Mise en place de l'environnement Ollama
- Installation et configuration d'Ollama
- Travail avec le déploiement local des modèles
- Intégration d'Ollama avec Python et Jupyter
Travail avec des entrées multimodales
- Intégration texte et image
- Incorporation d'audio et de données structurées
- Conception de pipelines de prétraitement
Applications de compréhension de documents
- Extraction d'informations structurées depuis des PDF et des images
- Combinaison de l'OCR avec les modèles de langage
- Construction de flux de travail d'analyse de documents intelligents
Réponse à des questions visuelles (VQA - Visual Question Answering)
- Mise en place des jeux de données et des benchmarks VQA
- Entraînement et évaluation des modèles multimodaux
- Construction d'applications VQA interactives
Conception d'agents multimodaux
- Principes de conception d'agents avec raisonnement multimodal
- Combinaison de la perception, du langage et de l'action
- Déploiement d'agents pour des cas d'usage réels
Intégration et optimisation avancées
- Affinage (fine-tuning) de modèles multimodaux avec Ollama
- Optimisation des performances d'inférence
- Considérations d'extensibilité et de déploiement
Synthèse et étapes suivantes
Pré requis
- Maîtrise solide des concepts d'apprentissage automatique (machine learning).
- Expérience avec des cadres de deep learning tels que PyTorch ou TensorFlow.
- Familiarité avec le traitement du langage naturel et la vision par ordinateur.
Public cible
- Ingénieurs en apprentissage automatique.
- Chercheurs en intelligence artificielle.
- Développeurs de produits intégrant des flux de travail vision et texte.