Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Plan du cours
Introduction à l'AIOps prédictif
- Aperçu de l'analytique prédictive dans les opérations IT
- Sources de données pour la prédiction (journaux, métriques, événements)
- Concepts clés dans la prévision des séries temporelles et les modèles d'anomalie
Conception de modèles de prédiction d'incidents
- Étiquetage des incidents historiques et du comportement du système
- Sélection et entraînement de modèles (par ex. LSTM, Random Forest, AutoML)
- Évaluation des performances du modèle et gestion des faux positifs
Collecte de données et ingénierie des caractéristiques
- Ingestion et alignement des données de journaux et de métriques pour l'entrée du modèle
- Extraction de caractéristiques à partir de données structurées et non structurées
- Gestion du bruit et des données manquantes dans les pipelines opérationnels
Automatisation de l'analyse des causes racines (RCA)
- Corrélation basée sur les graphes des services et de l'infrastructure
- Utilisation du ML pour inférer les causes racines probables à partir des chaînes d'événements
- Visualisation de la RCA avec des tableaux de bord sensibles à la topologie
Remédiation et automatisation des flux de travail
- Intégration avec des plateformes d'automatisation (par ex. Ansible, Rundeck)
- Déclenchement de retours arrière, redémarrages ou redirection de trafic
- Audit et documentation des interventions automatisées
Mise à l'échelle de pipelines AIOps intelligents
- MLOps pour l'observabilité : réentraînement et versionnage des modèles
- Exécution des prédictions en temps réel sur des nœuds distribués
- Bonnes pratiques pour le déploiement de l'AIOps dans les environnements de production
Études de cas et applications pratiques
- Analyse de données d'incidents réelles à l'aide de modèles AIOps prédictifs
- Déploiement de pipelines RCA avec des données synthétiques et de production
- Revue des cas d'usage sectoriels : pannes cloud, instabilité des microservices, dégradation du réseau
Résumé et prochaines étapes
Pré requis
- Expérience avec des systèmes de supervision tels que Prometheus ou ELK
- Connaissances opérationnelles de Python et de l'apprentissage automatique de base
- Familiarité avec les flux de travail de gestion des incidents
Public cible
- Ingénieurs de fiabilité des sites (SRE) seniors
- Architectes en automatisation IT
- Responsables DevOps et de plateformes d'observabilité
14 Heures