Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Plan du cours
Introduction à l'IA agissante pour les opérations
- Des runbooks statiques aux agents de raisonnement : l'évolution de l'automatisation informatique
- Anatomie de l'agent : boucle de raisonnement, utilisation d'outils, mémoire et planification
- Lorsqu'il faut automatiser vs lorsque garder l'humain dans la boucle
Frameworks et architectures d'agents
- Modèles mono-agent : ReAct, Plan-and-Execute et boucles d'appel d'outils
- Architectures multi-agents : motifs superviseur, hiérarchiques et essaim
- Comparaison des frameworks : LangGraph, CrewAI, AutoGen et agents sur mesure
- Construction de votre premier agent opérationnel : interrogation de la surveillance, diagnostic, proposition
Intégration d'outils pour les opérations informatiques
- Connexion des agents aux API de Prometheus, Grafana, Datadog et PagerDuty
- Interrogation des journaux par les agents : intégration d'Elasticsearch, Loki et Splunk
- Utilisation d'outils d'infrastructure : kubectl, Terraform, Ansible via des actions d'agent
- Conception d'interfaces d'outils sûres avec validation des paramètres et idempotence
Automatisation de la réponse aux incidents
- Triage automatisé des incidents : classification de la sévérité et routage
- Génération d'hypothèses de causes racines et collecte de preuves
- Remédiation automatisée : redémarrage, mise à l'échelle, retour en arrière et basculement
- Construction d'un agent de runbook d'incidents avec des niveaux d'autonomie progressive
Sécurité, garde-fous et intervention humaine
- Classification des actions : lecture seule, risque faible, risque élevé et destructives
- Portes d'approbation et politiques d'escalade pour les opérations critiques
- Modèles de garde-fous : listes blanches d'actions, limites de rayon d'impact et garanties de retour en arrière
- Journaux d'audit et traçabilité des décisions pour la conformité
Orchestration multi-agents pour les incidents complexes
- Coordination des agents spécialisés : agent de triage, agent de diagnostic, agent de remédiation
- Communication inter-agents et gestion du contexte partagé
- Résolution des conflits lorsque les agents proposent des actions contradictoires
- Simulation de bout en bout d'un incident majeur avec une réponse multi-agents
Observabilité et évaluation
- Suivi des chaînes de raisonnement des agents pour le débogage et l'audit
- Évaluation de la qualité des décisions des agents : précision, rappel, temps de résolution
- Boucles de rétroaction : apprentissage des corrections de l'opérateur et des résultats
- Suivi des coûts et économie des jetons pour les agents opérationnels
Déploiement en production et exploitation
- Déploiement des agents en tant que services : API, webhooks et tâches planifiées
- Déploiement de l'autonomie progressive : mode ombre à la remédiation entièrement automatisée
- Runbook pour les pannes d'agent : que se passe-t-il lorsque l'agent lui-même tombe en panne
- Construction du dossier d'investissement et mesure du ROI pour les opérations autonomes
Pré requis
- Expérience en opérations informatiques, DevOps ou pratiques SRE.
- Familiarité avec le script Python et les API REST.
- Compréhension de base des capacités des LLM et de l'ingénierie de prompts.
Public visé
- Ingénieurs SRE et DevOps explorant l'automatisation par IA.
- Ingénieurs en plateforme construisant des infrastructures autonomes de guérison.
- Responsables des opérations informatiques évaluant l'IA agissante pour la gestion des incidents.
14 Heures