Prenez contact avec nous

Plan du cours

Introduction à l'AIOps prédictif

  • Aperçu de l'analytique prédictive dans les opérations IT
  • Sources de données pour la prédiction (journaux, métriques, événements)
  • Concepts clés dans la prévision des séries temporelles et les modèles d'anomalie

Conception de modèles de prédiction d'incidents

  • Étiquetage des incidents historiques et du comportement du système
  • Sélection et entraînement de modèles (par ex. LSTM, Random Forest, AutoML)
  • Évaluation des performances du modèle et gestion des faux positifs

Collecte de données et ingénierie des caractéristiques

  • Ingestion et alignement des données de journaux et de métriques pour l'entrée du modèle
  • Extraction de caractéristiques à partir de données structurées et non structurées
  • Gestion du bruit et des données manquantes dans les pipelines opérationnels

Automatisation de l'analyse des causes racines (RCA)

  • Corrélation basée sur les graphes des services et de l'infrastructure
  • Utilisation du ML pour inférer les causes racines probables à partir des chaînes d'événements
  • Visualisation de la RCA avec des tableaux de bord sensibles à la topologie

Remédiation et automatisation des flux de travail

  • Intégration avec des plateformes d'automatisation (par ex. Ansible, Rundeck)
  • Déclenchement de retours arrière, redémarrages ou redirection de trafic
  • Audit et documentation des interventions automatisées

Mise à l'échelle de pipelines AIOps intelligents

  • MLOps pour l'observabilité : réentraînement et versionnage des modèles
  • Exécution des prédictions en temps réel sur des nœuds distribués
  • Bonnes pratiques pour le déploiement de l'AIOps dans les environnements de production

Études de cas et applications pratiques

  • Analyse de données d'incidents réelles à l'aide de modèles AIOps prédictifs
  • Déploiement de pipelines RCA avec des données synthétiques et de production
  • Revue des cas d'usage sectoriels : pannes cloud, instabilité des microservices, dégradation du réseau

Résumé et prochaines étapes

Pré requis

  • Expérience avec des systèmes de supervision tels que Prometheus ou ELK
  • Connaissances opérationnelles de Python et de l'apprentissage automatique de base
  • Familiarité avec les flux de travail de gestion des incidents

Public cible

  • Ingénieurs de fiabilité des sites (SRE) seniors
  • Architectes en automatisation IT
  • Responsables DevOps et de plateformes d'observabilité
 14 Heures

Nombre de participants


Prix par participant

Cours à venir

Catégories Similaires