Prenez contact avec nous

Plan du cours

Fondamentaux de la production avec Tencent Hunyuan

  • Aperçu des scénarios de mise en service (serving) des modèles Tencent Hunyuan
  • Caractéristiques en production des modèles volumineux et MoE
  • Bottlenecks courants en matière de latence, de débit et de coût
  • Définition des objectifs de niveau de service (SLO) pour les charges de travail d'inférence

Architecture de déploiement et flux de mise en service

  • Composants clés d'une pile d'inférence de production
  • Choix entre les modèles de déploiement conteneurisés, sur site et cloud
  • Fondamentaux du chargement des modèles, du routage des requêtes et de l'allocation GPU
  • Conception axée sur la fiabilité et la simplicité opérationnelle

Optimisation de la latence en pratique

  • Utilisation de moteurs d'inférence optimisés tels que TensorRT, le cas échéant
  • Concepts du cache KV et réglage pratique du cache
  • Réduction des temps de démarrage, de préchauffement (warmup) et de réponse
  • Mesure du temps jusqu'au premier jeton et de la vitesse de génération des jetons

Débit, groupement par lots et efficacité GPU

  • Stratégies de groupement continu et par lots de requêtes
  • Gestion de la concurrence et du comportement des files d'attente
  • Amélioration de l'utilisation des GPU sans nuire à l'expérience utilisateur
  • Gestion des requêtes à contexte long et mixtes

Quantification et contrôle des coûts

  • Pourquoi la quantification est cruciale pour le déploiement en production
  • Arbitrages pratiques entre FP16, INT8 et autres options de précision courantes
  • Équilibre entre qualité du modèle, latence et coût des infrastructures
  • Élaboration d'une liste de vérification simple pour l'optimisation des coûts

Opérations, surveillance et examen de la préparation

  • Déclencheurs de scaling automatique pour les services d'inférence
  • Surveillance de la latence, du débit, de l'utilisation du cache et de l'état des GPU
  • Fondamentaux de la journalisation (logging), des alertes et de la gestion des incidents
  • Analyse d'un déploiement de référence et création d'un plan d'amélioration

Pré requis

  • Compréhension de base des workflows de déploiement et d'inférence des modèles de langage volumineux (LLM)
  • Expérience avec les conteneurs, les infrastructures cloud ou sur site (on-premise), et les services basés sur API
  • Connaissances opérationnelles en Python ou en tâches d'ingénierie système

Audience cible

  • Ingénieurs ML déployant des LLM en production
  • Ingénieurs plateforme responsables des services d'inférence basés sur GPU
  • Architectes solution concevant des plateformes de mise à disposition (serving) d'IA évolutives
 14 Heures

Nombre de participants


Prix par participant

Cours à venir

Catégories Similaires