Prenez contact avec nous
 Durée 21 heures (3 jours)

Plan du cours

Fondements de la classification audio

  • Types d'événements sonores : environnementaux, mécaniques, générés par l'humain
  • Aperçu des cas d'utilisation : surveillance, monitoring, automatisation
  • Classification audio par opposition à la détection et à la segmentation

Données audio et extraction de fonctionnalités

  • Types de fichiers et formats audio
  • Taux d'échantillonnage, fenêtrage et considérations relatives à la taille des trames
  • Extraction des MFCC, des fonctionnalités chroma et des mélo-spectrogrammes

Préparation et annotation des données

  • Jeux de données UrbanSound8K, ESC-50 et personnalisés
  • Annotation des événements sonores et des limites temporelles
  • Équilibrage des jeux de données et augmentation audio

Construction de modèles de classification audio

  • Utilisation de réseaux de neurones convolutifs (CNN) pour l'audio
  • Entrées du modèle : forme d'onde brute par opposition aux fonctionnalités
  • Fonctions de perte, métriques d'évaluation et surapprentissage

Détection d'événements et localisation temporelle

  • Stratégies de détection basées sur les trames et les segments
  • Post-traitement des détections à l'aide de seuils et de lissage
  • Visualisation des prédictions sur les chronologies audio

Sujets avancés et traitement en temps réel

  • Apprentissage par transfert pour les scénarios à faibles volumes de données
  • Déploiement des modèles avec TensorFlow Lite ou ONNX
  • Traitement audio en flux continu et considérations relatives à la latence

Développement de projets et scénarios d'application

  • Conception d'un flux complet : de l'ingestion à la classification
  • Développement d'un prototype de preuve de concept pour la surveillance, le contrôle qualité ou le monitoring
  • Journalisation, alertes et intégration avec des tableaux de bord ou des API

Résumé et prochaines étapes

Pré requis

  • Une compréhension des concepts de machine learning et de l'entraînement de modèles
  • De l'expérience en programmation Python et en prétraitement des données
  • Une familiarité avec les fondamentaux de l'audio numérique

Public visé

  • Scientifiques des données
  • Ingénieurs en machine learning
  • Chercheurs et développeurs en traitement du signal audio

Nombre de participants


Prix par participant

Cours à venir

Catégories Similaires