Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Plan du cours
Introduction à l'apprentissage par renforcement
- Aperçu de l'apprentissage par renforcement et de ses applications
- Différences entre l'apprentissage supervisé, non supervisé et par renforcement
- Concepts clés : agent, environnement, récompenses et politique
Processus de Décision de Markov (PDM)
- Compréhension des états, des actions, des récompenses et des transitions d'état
- Fonctions de valeur et équation de Bellman
- Programmation dynamique pour la résolution des PDM
Algorithmes RL fondamentaux
- Méthodes tabulaires : Q-Learning et SARSA
- Méthodes basées sur la politique : algorithme REINFORCE
- Cadres Actor-Critic et leurs applications
Deep Reinforcement Learning
- Introduction aux Deep Q-Networks (DQN)
- Rejeu d'expérience (experience replay) et réseaux cible
- Gradients de politique et méthodes avancées de deep RL
Cadres et outils RL
- Introduction à OpenAI Gym et autres environnements RL
- Utilisation de PyTorch ou TensorFlow pour le développement de modèles RL
- Entraînement, test et évaluation (benchmarking) des agents RL
Défis en RL
- Équilibre entre exploration et exploitation lors de l'entraînement
- Gestion des récompenses rares et des problèmes d'attribution de mérite (credit assignment)
- Scalabilité et défis computationnels en RL
Activités pratiques
- Implémentation des algorithmes Q-Learning et SARSA depuis zéro
- Entraînement d'un agent basé sur DQN pour jouer à un jeu simple dans OpenAI Gym
- Réglage fin de modèles RL pour améliorer les performances dans des environnements personnalisés
Synthèse et prochaines étapes
Pré requis
- Bonne compréhension des principes et algorithmes de l'apprentissage automatique
- Maîtrise de la programmation en Python
- Notions de base des réseaux de neurones et des cadres de deep learning
Public cible
- Ingénieurs en apprentissage automatique
- Spécialistes de l'IA
14 Heures