Prenez contact avec nous
 Durée 21 heures

Plan du cours

Introduction à la mise à l'échelle d'Ollama

  • architecture d'Ollama et considérations relatives à la mise à l'échelle
  • goulots d'étranglement courants dans les déploiements multi-utilisateurs
  • bonnes pratiques pour la préparation de l'infrastructure

Allocation des ressources et optimisation GPU

  • stratégies d'utilisation efficace des ressources CPU/GPU
  • considérations sur la mémoire et la bande passante
  • contraintes de ressources au niveau des conteneurs

Déploiement avec conteneurs et Kubernetes

  • conteneurisation d'Ollama avec Docker
  • exécution d'Ollama dans des clusters Kubernetes
  • équilibrage de charge et découverte de services

Mise à l'échelle automatique et regroupement

  • conception de politiques de mise à l'échelle automatique pour Ollama
  • techniques d'inférence par lots pour l'optimisation du débit
  • compromis entre latence et débit

Optimisation de la latence

  • profilage des performances d'inférence
  • stratégies de mise en cache et préchauffage des modèles
  • réduction de la surcharge d'entrées/sorties et de communication

Surveillance et observabilité

  • intégration de Prometheus pour les métriques
  • création de tableaux de bord avec Grafana
  • alertes et gestion des incidents pour l'infrastructure Ollama

Gestion des coûts et stratégies de mise à l'échelle

  • allocation de GPU sensible aux coûts
  • considérations pour le déploiement cloud vs sur site (on-prem)
  • stratégies pour une mise à l'échelle durable

Résumé et prochaines étapes

Pré requis

  • Expérience en administration de systèmes Linux
  • Compréhension de la conteneurisation et de l'orchestration
  • Connaissance du déploiement de modèles d'apprentissage automatique

Public cible

  • Ingénieurs DevOps
  • Équipes d'infrastructure ML
  • Ingénieurs en fiabilité des sites (SRE)

Nombre de participants


Prix par participant

Cours à venir

Catégories Similaires