Thank you for sending your enquiry! One of our team members will contact you shortly.
Thank you for sending your booking! One of our team members will contact you shortly.
Course Outline
Foundations of Audio Classification
- Types of sound events: environmental, mechanical, and human-generated
- Overview of applications: surveillance, monitoring, and automation
- Distinguishing between audio classification, detection, and segmentation
Audio Data and Feature Extraction
- Varieties of audio files and formats
- Considerations for sampling rates, windowing, and frame sizes
- Extraction of MFCCs, chroma features, and mel-spectrograms
Data Preparation and Annotation
- Utilizing datasets such as UrbanSound8K, ESC-50, and custom collections
- Annotation of sound events and their temporal boundaries
- Dataset balancing and audio augmentation strategies
Building Audio Classification Models
- Application of convolutional neural networks (CNNs) to audio data
- Model inputs: raw waveforms versus extracted features
- Selection of loss functions, evaluation metrics, and management of overfitting
Event Detection and Temporal Localization
- Strategies for frame-based and segment-based detection
- Post-processing of detections through thresholds and smoothing techniques
- Visualization of predictions across audio timelines
Advanced Topics and Real-Time Processing
- Employing transfer learning for scenarios with limited data
- Model deployment using TensorFlow Lite or ONNX
- Streaming audio processing and latency optimization
Project Development and Application Scenarios
- Architecting a complete pipeline from ingestion to classification
- Creating proofs-of-concept for surveillance, quality control, or monitoring
- Implementation of logging, alerting, and integration with dashboards or APIs
Summary and Next Steps
Requirements
- Familiarity with machine learning principles and model training processes
- Proficiency in Python programming and data preprocessing techniques
- Knowledge of digital audio basics
Target Audience
- Data scientists
- Machine learning engineers
- Researchers and developers specializing in audio signal processing
21 Hours