Thank you for sending your enquiry! One of our team members will contact you shortly.
Thank you for sending your booking! One of our team members will contact you shortly.
Duration 21 hours (3 days)
Course Outline
Foundations of Audio Classification
- Categorizing sound events: environmental, mechanical, and human-generated
- Overview of applications: surveillance, monitoring, and automation
- Distinguishing between audio classification, detection, and segmentation
Audio Data and Feature Extraction
- Varieties of audio file types and formats
- Considerations for sampling rates, windowing, and frame sizes
- Extracting MFCCs, chroma features, and mel-spectrograms
Data Preparation and Annotation
- Utilizing datasets such as UrbanSound8K, ESC-50, and custom collections
- Annotating sound events and their temporal boundaries
- Techniques for balancing datasets and augmenting audio
Building Audio Classification Models
- Application of convolutional neural networks (CNNs) to audio data
- Input strategies: raw waveforms versus extracted features
- Selecting loss functions, evaluation metrics, and managing overfitting
Event Detection and Temporal Localization
- Strategies for frame-based and segment-based detection
- Refining detections through thresholding and smoothing techniques
- Visualizing predictions across audio timelines
Advanced Topics and Real-Time Processing
- Implementing transfer learning in low-data scenarios
- Model deployment using TensorFlow Lite or ONNX
- Managing streaming audio processing and latency requirements
Project Development and Application Scenarios
- Architecting a complete pipeline from data ingestion to classification
- Creating proof-of-concepts for surveillance, quality control, or monitoring systems
- Integrating logging, alerting, and dashboard or API connections
Summary and Next Steps
Requirements
- Foundational knowledge of machine learning concepts and model training processes
- Proficiency in Python programming and data preprocessing workflows
- Basic familiarity with the fundamentals of digital audio
Target Audience
- Data scientists
- Machine learning engineers
- Researchers and developers specializing in audio signal processing