Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Durée 21 heures (3 jours)
Plan du cours
Fondements de la classification audio
- Types d'événements sonores : environnementaux, mécaniques, générés par l'humain
- Aperçu des cas d'utilisation : surveillance, monitoring, automatisation
- Classification audio par opposition à la détection et à la segmentation
Données audio et extraction de fonctionnalités
- Types de fichiers et formats audio
- Taux d'échantillonnage, fenêtrage et considérations relatives à la taille des trames
- Extraction des MFCC, des fonctionnalités chroma et des mélo-spectrogrammes
Préparation et annotation des données
- Jeux de données UrbanSound8K, ESC-50 et personnalisés
- Annotation des événements sonores et des limites temporelles
- Équilibrage des jeux de données et augmentation audio
Construction de modèles de classification audio
- Utilisation de réseaux de neurones convolutifs (CNN) pour l'audio
- Entrées du modèle : forme d'onde brute par opposition aux fonctionnalités
- Fonctions de perte, métriques d'évaluation et surapprentissage
Détection d'événements et localisation temporelle
- Stratégies de détection basées sur les trames et les segments
- Post-traitement des détections à l'aide de seuils et de lissage
- Visualisation des prédictions sur les chronologies audio
Sujets avancés et traitement en temps réel
- Apprentissage par transfert pour les scénarios à faibles volumes de données
- Déploiement des modèles avec TensorFlow Lite ou ONNX
- Traitement audio en flux continu et considérations relatives à la latence
Développement de projets et scénarios d'application
- Conception d'un flux complet : de l'ingestion à la classification
- Développement d'un prototype de preuve de concept pour la surveillance, le contrôle qualité ou le monitoring
- Journalisation, alertes et intégration avec des tableaux de bord ou des API
Résumé et prochaines étapes
Pré requis
- Une compréhension des concepts de machine learning et de l'entraînement de modèles
- De l'expérience en programmation Python et en prétraitement des données
- Une familiarité avec les fondamentaux de l'audio numérique
Public visé
- Scientifiques des données
- Ingénieurs en machine learning
- Chercheurs et développeurs en traitement du signal audio