Prenez contact avec nous

Plan du cours

Introduction à l'IA agissante pour les opérations

  • Des runbooks statiques aux agents de raisonnement : l'évolution de l'automatisation informatique
  • Anatomie de l'agent : boucle de raisonnement, utilisation d'outils, mémoire et planification
  • Lorsqu'il faut automatiser vs lorsque garder l'humain dans la boucle

Frameworks et architectures d'agents

  • Modèles mono-agent : ReAct, Plan-and-Execute et boucles d'appel d'outils
  • Architectures multi-agents : motifs superviseur, hiérarchiques et essaim
  • Comparaison des frameworks : LangGraph, CrewAI, AutoGen et agents sur mesure
  • Construction de votre premier agent opérationnel : interrogation de la surveillance, diagnostic, proposition

Intégration d'outils pour les opérations informatiques

  • Connexion des agents aux API de Prometheus, Grafana, Datadog et PagerDuty
  • Interrogation des journaux par les agents : intégration d'Elasticsearch, Loki et Splunk
  • Utilisation d'outils d'infrastructure : kubectl, Terraform, Ansible via des actions d'agent
  • Conception d'interfaces d'outils sûres avec validation des paramètres et idempotence

Automatisation de la réponse aux incidents

  • Triage automatisé des incidents : classification de la sévérité et routage
  • Génération d'hypothèses de causes racines et collecte de preuves
  • Remédiation automatisée : redémarrage, mise à l'échelle, retour en arrière et basculement
  • Construction d'un agent de runbook d'incidents avec des niveaux d'autonomie progressive

Sécurité, garde-fous et intervention humaine

  • Classification des actions : lecture seule, risque faible, risque élevé et destructives
  • Portes d'approbation et politiques d'escalade pour les opérations critiques
  • Modèles de garde-fous : listes blanches d'actions, limites de rayon d'impact et garanties de retour en arrière
  • Journaux d'audit et traçabilité des décisions pour la conformité

Orchestration multi-agents pour les incidents complexes

  • Coordination des agents spécialisés : agent de triage, agent de diagnostic, agent de remédiation
  • Communication inter-agents et gestion du contexte partagé
  • Résolution des conflits lorsque les agents proposent des actions contradictoires
  • Simulation de bout en bout d'un incident majeur avec une réponse multi-agents

Observabilité et évaluation

  • Suivi des chaînes de raisonnement des agents pour le débogage et l'audit
  • Évaluation de la qualité des décisions des agents : précision, rappel, temps de résolution
  • Boucles de rétroaction : apprentissage des corrections de l'opérateur et des résultats
  • Suivi des coûts et économie des jetons pour les agents opérationnels

Déploiement en production et exploitation

  • Déploiement des agents en tant que services : API, webhooks et tâches planifiées
  • Déploiement de l'autonomie progressive : mode ombre à la remédiation entièrement automatisée
  • Runbook pour les pannes d'agent : que se passe-t-il lorsque l'agent lui-même tombe en panne
  • Construction du dossier d'investissement et mesure du ROI pour les opérations autonomes

Pré requis

  • Expérience en opérations informatiques, DevOps ou pratiques SRE.
  • Familiarité avec le script Python et les API REST.
  • Compréhension de base des capacités des LLM et de l'ingénierie de prompts.

Public visé

  • Ingénieurs SRE et DevOps explorant l'automatisation par IA.
  • Ingénieurs en plateforme construisant des infrastructures autonomes de guérison.
  • Responsables des opérations informatiques évaluant l'IA agissante pour la gestion des incidents.
 14 Heures

Nombre de participants


Prix par participant

Cours à venir

Catégories Similaires