Plan du cours
Infrastructure as Code pour EXO
- Aperçu des modes de déploiement EXO : cluster mono-noeud, multi-nœuds et clusters RDMA.
- Automatisation de l'installation des dépendances (Xcode, uv, Node.js, Rust) via la gestion de configuration.
- Utilisation de Nix flakes pour des builds EXO reproductibles et des environnements développeur.
- Rédaction de playbooks Ansible ou de scripts shell pour le provisionnement non supervisé des clusters.
Builds reproductibles et intégration CI
- Épinglage des dépendances et construction du tableau de bord dans les pipelines CI.
- Exécution des tests de base (smoke tests) EXO sur GitHub Actions ou GitLab CI runners.
- Création d'imagesgolden et de workflows de retour arrière basés sur des instantanés pour les VMs macOS et Linux.
- Versionnement des fiches modèles personnalisées avec le code applicatif.
Découverte du cluster et automatisation réseau
- Configuration de mDNS et de DNS statique pour une découverte fiable des noeuds libp2p.
- Automatisation de la création de profils réseau et de la gestion du pont Thunderbolt sous macOS.
- Utilisation de namespaces personnalisés (EXO_LIBP2P_NAMESPACE) pour séparer les clusters dev, staging et prod.
- Règles de pare-feu et segmentation réseau pour les environnements multi-tenants.
Gestion du stockage et du cycle de vie des modèles
- Conception des stratégies EXO_MODELS_DIRS et EXO_MODELS_READ_ONLY_DIRS.
- Montage de partages NFS ou SAN en tant que référentiels de modèles en lecture seule pour un provisionnement rapide.
- Nettoyage des caches obsolètes et politiques de rétention des poids versionnés.
- Automatisation du pré-téléchargement des modèles et des vérifications d'intégrité avant les mises à jour progressives.
Surveillance et alertes
- Envoi des logs EXO vers une journalisation centralisée (ELK, Loki ou Splunk).
- Construction de tableaux de bord Grafana à partir des sorties EXO_TRACING_ENABLED.
- Alertes sur les changements d'appartenance au cluster, les événements OOM et les pics de latence d'inférence.
- Corrélation de la télémétrique matérielle macmon avec les régressions de performance des modèles.
Mises à jour, retours arrière (rollback) et reprise après sinistre
- Préparation des mises à jour binaires EXO sur un noeud canari avant le déploiement à l'échelle du parc.
- Retour arrière au niveau des modèles : bascule entre les versions quantifiées sans re-téléchargement.
- Sauvegarde et restauration de l'état du cluster, des namespaces personnalisés et des poids mis en cache.
- Documentation des playbooks de récupération pour les scénarios de reconstruction totale du cluster.
- Mise en œuvre de TLS au niveau de la couche reverse proxy (nginx, traefik) pour le tableau de bord et l'API.
- Mise en place de la limitation de débit API et du liste blanche d'adresses IP pour les points de terminaison EXO.
- Isolement des clusters avec des VLANs et des politiques réseau zero-trust.
- Audit des accès et tenue à jour de l'inventaire des modèles déployés et de leurs versions.
Pré requis
- Expérience avec les pratiques DevOps (CI/CD, IaC, orchestration de conteneurs)
- Connaissance de l'administration système macOS ou Linux et de la gestion des paquets.
- Compréhension des concepts réseau, DNS et de stockage.
Audience cible
- Ingénieurs DevOps
- Architectes infrastructure
- SRE responsables des charges de travail d'IA sur site
Nos clients témoignent (2)
Craig était très impliqué dans la formation, toujours en s'assurant que nous prêtions attention, en adaptant les exemples à nos activités quotidiennes et en fournissant une réponse chaque fois qu'on lui posait une question, même si l'information n'était pas incluse dans la présentation.
Ecaterina Ioana Nicoale - BOOKING HOLDINGS ROMANIA SRL
Formation - DevOps Foundation®
Traduction automatique
Niveau élevé d’engagement et de connaissances du formateur
Jacek - Softsystem
Formation - DevOps Engineering Foundation (DOEF)®
Traduction automatique