Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Durée 14 heures (2 jours)
Plan du cours
Aperçu des technologies de reconnaissance vocale
- Histoire et évolution de la reconnaissance vocale
- Modèles acoustiques, modèles linguistiques et décodage
- Architectures modernes : RNN, transformers et Whisper
Prétraitement audio et bases de la transcription
- Gestion des formats audio et des fréquences d'échantillonnage
- Nettoyage, rognage et segmentation de l'audio
- Génération de texte à partir de l'audio : temps réel par rapport au lot
Manipulation pratique avec Whisper et d'autres API
- Installation et utilisation de OpenAI Whisper
- Appels d'API cloud (Google, Azure) pour la transcription
- Comparaison des performances, de la latence et des coûts
Langues, accents et adaptation au domaine
- Travail avec plusieurs langues et accents
- Vocabulaires personnalisés et tolérance au bruit
- Gestion du langage juridique, médical ou technique
Mise en forme des sorties et intégration
- Ajout de horodatages, de ponctuation et d'étiquettes de locuteur
- Exportation vers des formats texte, SRT ou JSON
- Intégration des transcriptions dans des applications ou des bases de données
Laboratoires de mise en œuvre de cas d'usage
- Transcription de réunions, d'entretiens ou de podcasts
- Systèmes de commandes vocales en texte
- Sous-titres en temps réel pour les flux vidéo/audios
Évaluation, limites et éthique
- Métriques de précision et benchmarking des modèles
- Biais et équité dans les modèles vocaux
- Considérations de confidentialité et de conformité
Résumé et prochaines étapes
Pré requis
- Une compréhension des concepts généraux de l'IA et de l'apprentissage automatique
- Une familiarité avec les formats et les outils de fichiers audio ou médias
Public cible
- Data scientists et ingénieurs IA travaillant avec des données vocales
- Développeurs logiciels créant des applications basées sur la transcription
- Organisations explorant la reconnaissance vocale pour l'automatisation