Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Plan du cours
Introduction à EXO et au clustering IA local
- Vue d'ensemble du framework EXO et de l'écosystème exo-explore
- Comparaison entre l'inférence cloud centralisée et l'inférence locale distribuée
- Architecture : découverte libp2p des appareils, backend MLX, tableau de bord et couches API
- Besoins matériels : Apple Silicon (M3 Ultra, M4 Pro/Max), Thunderbolt 5, stockage partagé
Installation d'EXO sur macOS
- Configuration de Xcode, de la Metal ToolChain et des prérequis macOS
- Installation de uv, Node.js, chaîne d'outils Rust nightly
- Installation de la fourche macmon pinned pour le monitoring Apple Silicon
- Clonage du dépôt et construction du tableau de bord avec npm
- Lancement d'EXO depuis les sources et vérification du tableau de bord localhost:52415
Installation d'EXO sur Linux
- Installation des dépendances via apt ou Homebrew sur Linux
- Configuration de uv, Node.js 18+ et Rust nightly
- Construction du tableau de bord et exécution d'EXO en mode CPU uniquement
- Dissection des répertoires : chemins XDG Base Directory pour la configuration, les données, le cache et les journaux
Découverte automatique des appareils et formation du cluster
- Compréhension de l'auto-découverte libp2p à travers les réseaux locaux
- Configuration de noms de namespace personnalisés avec EXO_LIBP2P_NAMESPACE pour l'isolation des clusters
- Vérification de l'appartenance des nœuds dans la vue cluster du tableau de bord
- Gestion des échecs de découverte et problèmes de segmentation réseau
Activation de RDMA via Thunderbolt 5
- Architecture RDMA et affirmation d'une réduction de latence de 99 pour cent
- Activation de RDMA en mode récupération macOS avec rdma_ctl
- Exigences câbles et contraintes topologie des ports sur Mac Studio
- Correspondance des versions macOS entre tous les nœuds du cluster
- Dépannage de la découverte RDMA et configuration DHCP
Déploiement de modèles avancés
- Utilisation du tableau de bord pour charger et partitionner DeepSeek v3.1, Qwen3-235B et les modèles Llama
- Aperçu des emplacements des instances avec le point de terminaison /instance/previews API
- Création d'instances de modèles avec partitionnement par pipeline ou parallélisme tensoriel
- Configuration de cartes modèles personnalisées depuis HuggingFace hub
Surveillance et dépannage
- Lecture des journaux EXO et compréhension du traçage distribué
- Interprétation de la santé du cluster dans la vue cluster du tableau de bord
- Diagnostic des échecs des nœuds workers et comportement de reconnexion
- Utilisation d'EXO_TRACING_ENABLED pour l'analyse des goulets d'étranglement de performance
Maintenance et mises à jour du cluster
- Mise à jour des binaires EXO et procédures de reconstruction du tableau de bord
- Migration des caches de modèles et gestion des modèles pré-téléchargés via NFS
- Suppression ordonnée des nœuds et rééquilibrage des charges de travail
Pré requis
- Une compréhension des fondamentaux des réseaux (IP, sous-réseautage, pare-feu)
- Expérience avec l'administration en ligne de commande macOS ou Linux
- Connaissance de la gestion des packages Python (pip/uv) et des outils Node.js
Audience cible
- Administrateurs système
- Ingénieurs DevOps
- Architectes d'infrastructure IA responsables du déploiement de LLMs sur site
21 Heures