Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Durée 14 heures
Plan du cours
Introduction à la synthèse vocale et au clonage vocal
- Aperçu de la synthèse vocale texte à parole (TTS) et de la synthèse vocale neuronale
- Clonage vocal par rapport à la génération de parole : cas d'usage et limites
- Modèles clés : Tacotron, WaveNet, FastSpeech, VITS
Travail avec des plateformes commerciales
- Utilisation de ElevenLabs et Resemble AI
- Création, clonage et édition de voix
- Accès API et flux de travail de synthèse vocale
Développement avec des outils open source
- Installation et configuration de Coqui TTS
- Entraînement de voix personnalisées et gestion des jeux de données
- Génération de parole avec un contrôle fin (ton, vitesse, émotion)
Préparation des données et gestion des jeux de données vocaux
- Collecte et nettoyage d'échantillons vocaux
- Segmentation, étiquetage et alignement des transcriptions
- Sourcing éthique et consentement vocal
Intégration d'applications
- Intégration de la TTS dans les sites web et les applications
- Création de systèmes IVR et de bots interactifs
- Génération de dialogues synthétiques pour la vidéo et les jeux
Évaluation de la qualité et du réalisme
- MOS (Score d'Opinion Moyen) et tests de compréhension
- Contrôle de l'expressivité et de la prosodie
- Comparaison de la latence, de la fidélité et du réalisme
Considérations éthiques, juridiques et de gouvernance
- Risques de deepfakes et utilisation responsable
- Consentement, attribution et implications en matière de droits d'auteur
- Réglementations et politiques organisationnelles
Résumé et prochaines étapes
Pré requis
- Compréhension des fondamentaux de l'apprentissage automatique
- Familiarité avec les formats de fichiers audio et les outils d'édition
- Compétences de base en programmation Python
Public cible
- Développeurs et ingénieurs IA intéressés par la synthèse vocale
- Créateurs de contenu et techniciens médias explorant la génération vocale
- Équipes R&D concevant des systèmes audio personnalisés ou dynamiques