Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Durée 14 heures
Plan du cours
Fondamentaux de la production avec Tencent Hunyuan
- Aperçu des scénarios de mise en service (serving) des modèles Tencent Hunyuan
- Caractéristiques en production des modèles volumineux et MoE
- Bottlenecks courants en matière de latence, de débit et de coût
- Définition des objectifs de niveau de service (SLO) pour les charges de travail d'inférence
Architecture de déploiement et flux de mise en service
- Composants clés d'une pile d'inférence de production
- Choix entre les modèles de déploiement conteneurisés, sur site et cloud
- Fondamentaux du chargement des modèles, du routage des requêtes et de l'allocation GPU
- Conception axée sur la fiabilité et la simplicité opérationnelle
Optimisation de la latence en pratique
- Utilisation de moteurs d'inférence optimisés tels que TensorRT, le cas échéant
- Concepts du cache KV et réglage pratique du cache
- Réduction des temps de démarrage, de préchauffement (warmup) et de réponse
- Mesure du temps jusqu'au premier jeton et de la vitesse de génération des jetons
Débit, groupement par lots et efficacité GPU
- Stratégies de groupement continu et par lots de requêtes
- Gestion de la concurrence et du comportement des files d'attente
- Amélioration de l'utilisation des GPU sans nuire à l'expérience utilisateur
- Gestion des requêtes à contexte long et mixtes
Quantification et contrôle des coûts
- Pourquoi la quantification est cruciale pour le déploiement en production
- Arbitrages pratiques entre FP16, INT8 et autres options de précision courantes
- Équilibre entre qualité du modèle, latence et coût des infrastructures
- Élaboration d'une liste de vérification simple pour l'optimisation des coûts
Opérations, surveillance et examen de la préparation
- Déclencheurs de scaling automatique pour les services d'inférence
- Surveillance de la latence, du débit, de l'utilisation du cache et de l'état des GPU
- Fondamentaux de la journalisation (logging), des alertes et de la gestion des incidents
- Analyse d'un déploiement de référence et création d'un plan d'amélioration
Pré requis
- Compréhension de base des workflows de déploiement et d'inférence des modèles de langage volumineux (LLM)
- Expérience avec les conteneurs, les infrastructures cloud ou sur site (on-premise), et les services basés sur API
- Connaissances opérationnelles en Python ou en tâches d'ingénierie système
Audience cible
- Ingénieurs ML déployant des LLM en production
- Ingénieurs plateforme responsables des services d'inférence basés sur GPU
- Architectes solution concevant des plateformes de mise à disposition (serving) d'IA évolutives