Prenez contact avec nous

Plan du cours

Le paysage de l'observabilité par l'IA

  • Des tableaux de bord aux conversations : le passage à une observabilité augmentée par l'IA.
  • Les capacités des LLM pertinentes pour l'observabilité : résumé, raisonnement, correspondance de motifs.
  • Architectures de référence : intégration de l'IA dans les chaînes d'observabilité existantes.

Interrogation des télémétries en langage naturel

  • De texte à PromQL : traduction du langage naturel en requêtes de supervision.
  • Requêtage en langage naturel pour Elasticsearch, OpenSearch et les entrepôts de journaux Loki.
  • Génération SQL à partir du langage naturel pour la télémétrie structurée.
  • Conception d'un agent assistant aux requêtes avec usage d'outils et prise en compte du contexte.

Analyse des journaux par les LLM

  • Analyse et structuration automatiques des journaux avec les LLM.
  • Détection d'anomalies dans les flux de journaux grâce à la similarité des embeddings.
  • Clustering des journaux et découverte de motifs à grande échelle.
  • Génération d'explications lisibles par l'homme à partir de séquences de journaux brutes.

Alerting intelligent et enrichissement des incidents

  • Corrélation et déduplication des alertes avec compréhension sémantique.
  • Rassemblement automatique du contexte de l'incident à partir des manuels d'exécution (runbooks), des incidents passés et des documentations.
  • Routage intelligent des alertes basé sur la compréhension du contenu et l'expertise de l'équipe.
  • Réduction de la fatigue due aux alertes grâce à la réduction du bruit pilotée par l'IA.

Analyse des causes racines assistée par l'IA

  • Génération d'hypothèses à partir de la corrélation de télémétries multi-sources.
  • Enchaînement des preuves : connexion des symptômes entre les métriques, les journaux et les traces.
  • Dépannage guidé avec des sessions de diagnostic IA interactives.
  • Conception d'un agent d'analyse des causes racines avec enquête progressive.

Réponse automatisée aux incidents et communication

  • Génération de résumés d'incidents et de mises à jour d'état à partir de la télémétrie.
  • Rédaction automatique de post-mortem avec reconstitution de la chronologie.
  • Communication adaptée aux parties prenantes techniques et exécutives.
  • Suggestions de runbooks et recommandations de remédiations automatisées.

Machine Learning pour l'observabilité

  • Prévision de séries temporelles pour la planification des capacités et la prédiction d'anomalies.
  • Modèles fondamentaux pour la détection d'anomalies en zéro apprentissage (zero-shot) sur les métriques.
  • Cartographie des dépendances de services et découverte de topologie basées sur les embeddings.
  • Entraînement et déploiement de modèles ML légers aux côtés des pipelines d'observabilité.

Déploiement en production et éthique

  • Considérations en matière de latence et de coût pour l'observabilité IA en temps réel.
  • Vie privée des données : garantir que les LLM ne divulguent pas de télémétrie sensible.
  • Supervision humaine : quand le diagnostic par l'IA nécessite une validation par un opérateur.
  • Mesure de l'impact : MTTD (Mean Time To Detect), MTTR (Mean Time To Resolve) et indicateurs de la garde.

Pré requis

  • Expérience avec des outils d'observabilité tels que Prometheus, Grafana, Datadog ou OpenTelemetry.
  • Connaissance des concepts de gestion des journaux et des métriques.
  • Scripting Python de base pour le traitement des données.

Public cible

  • Ingénieurs SRE et observabilité adoptant des outils améliorés par l'IA.
  • Ingénieurs plateforme construisant des pipelines de supervision de nouvelle génération.
  • Chefs DevOps évaluant l'intégration des LLM dans les flux de travail liés aux incidents.
 14 Heures

Nombre de participants


Prix par participant

Cours à venir

Catégories Similaires