Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Durée 21 heures
Plan du cours
Introduction à la mise à l'échelle d'Ollama
- architecture d'Ollama et considérations relatives à la mise à l'échelle
- goulots d'étranglement courants dans les déploiements multi-utilisateurs
- bonnes pratiques pour la préparation de l'infrastructure
Allocation des ressources et optimisation GPU
- stratégies d'utilisation efficace des ressources CPU/GPU
- considérations sur la mémoire et la bande passante
- contraintes de ressources au niveau des conteneurs
Déploiement avec conteneurs et Kubernetes
- conteneurisation d'Ollama avec Docker
- exécution d'Ollama dans des clusters Kubernetes
- équilibrage de charge et découverte de services
Mise à l'échelle automatique et regroupement
- conception de politiques de mise à l'échelle automatique pour Ollama
- techniques d'inférence par lots pour l'optimisation du débit
- compromis entre latence et débit
Optimisation de la latence
- profilage des performances d'inférence
- stratégies de mise en cache et préchauffage des modèles
- réduction de la surcharge d'entrées/sorties et de communication
Surveillance et observabilité
- intégration de Prometheus pour les métriques
- création de tableaux de bord avec Grafana
- alertes et gestion des incidents pour l'infrastructure Ollama
Gestion des coûts et stratégies de mise à l'échelle
- allocation de GPU sensible aux coûts
- considérations pour le déploiement cloud vs sur site (on-prem)
- stratégies pour une mise à l'échelle durable
Résumé et prochaines étapes
Pré requis
- Expérience en administration de systèmes Linux
- Compréhension de la conteneurisation et de l'orchestration
- Connaissance du déploiement de modèles d'apprentissage automatique
Public cible
- Ingénieurs DevOps
- Équipes d'infrastructure ML
- Ingénieurs en fiabilité des sites (SRE)