Prenez contact avec nous

Plan du cours

Infrastructure as Code pour EXO

  • Aperçu des modes de déploiement EXO : cluster mono-noeud, multi-nœuds et clusters RDMA.
  • Automatisation de l'installation des dépendances (Xcode, uv, Node.js, Rust) via la gestion de configuration.
  • Utilisation de Nix flakes pour des builds EXO reproductibles et des environnements développeur.
  • Rédaction de playbooks Ansible ou de scripts shell pour le provisionnement non supervisé des clusters.

Builds reproductibles et intégration CI

  • Épinglage des dépendances et construction du tableau de bord dans les pipelines CI.
  • Exécution des tests de base (smoke tests) EXO sur GitHub Actions ou GitLab CI runners.
  • Création d'imagesgolden et de workflows de retour arrière basés sur des instantanés pour les VMs macOS et Linux.
  • Versionnement des fiches modèles personnalisées avec le code applicatif.

Découverte du cluster et automatisation réseau

  • Configuration de mDNS et de DNS statique pour une découverte fiable des noeuds libp2p.
  • Automatisation de la création de profils réseau et de la gestion du pont Thunderbolt sous macOS.
  • Utilisation de namespaces personnalisés (EXO_LIBP2P_NAMESPACE) pour séparer les clusters dev, staging et prod.
  • Règles de pare-feu et segmentation réseau pour les environnements multi-tenants.

Gestion du stockage et du cycle de vie des modèles

  • Conception des stratégies EXO_MODELS_DIRS et EXO_MODELS_READ_ONLY_DIRS.
  • Montage de partages NFS ou SAN en tant que référentiels de modèles en lecture seule pour un provisionnement rapide.
  • Nettoyage des caches obsolètes et politiques de rétention des poids versionnés.
  • Automatisation du pré-téléchargement des modèles et des vérifications d'intégrité avant les mises à jour progressives.

Surveillance et alertes

  • Envoi des logs EXO vers une journalisation centralisée (ELK, Loki ou Splunk).
  • Construction de tableaux de bord Grafana à partir des sorties EXO_TRACING_ENABLED.
  • Alertes sur les changements d'appartenance au cluster, les événements OOM et les pics de latence d'inférence.
  • Corrélation de la télémétrique matérielle macmon avec les régressions de performance des modèles.

Mises à jour, retours arrière (rollback) et reprise après sinistre

  • Préparation des mises à jour binaires EXO sur un noeud canari avant le déploiement à l'échelle du parc.
  • Retour arrière au niveau des modèles : bascule entre les versions quantifiées sans re-téléchargement.
  • Sauvegarde et restauration de l'état du cluster, des namespaces personnalisés et des poids mis en cache.
  • Documentation des playbooks de récupération pour les scénarios de reconstruction totale du cluster.

  • Mise en œuvre de TLS au niveau de la couche reverse proxy (nginx, traefik) pour le tableau de bord et l'API.
  • Mise en place de la limitation de débit API et du liste blanche d'adresses IP pour les points de terminaison EXO.
  • Isolement des clusters avec des VLANs et des politiques réseau zero-trust.
  • Audit des accès et tenue à jour de l'inventaire des modèles déployés et de leurs versions.

Pré requis

  • Expérience avec les pratiques DevOps (CI/CD, IaC, orchestration de conteneurs)
  • Connaissance de l'administration système macOS ou Linux et de la gestion des paquets.
  • Compréhension des concepts réseau, DNS et de stockage.

Audience cible

  • Ingénieurs DevOps
  • Architectes infrastructure
  • SRE responsables des charges de travail d'IA sur site
 21 Heures

Nombre de participants


Prix par participant

Nos clients témoignent (2)

Cours à venir

Catégories Similaires