Thank you for sending your enquiry! One of our team members will contact you shortly.
Thank you for sending your booking! One of our team members will contact you shortly.
Duration 21 hours (3 days)
Course Outline
Foundations of Audio Classification
- Categories of sound events: environmental, mechanical, and human-generated.
- Overview of key use cases: surveillance, monitoring, and automation.
- Distinguishing between audio classification, detection, and segmentation.
Audio Data and Feature Extraction
- Variations in audio file types and formats.
- Considerations for sampling rates, windowing, and frame sizes.
- Extraction of MFCCs, chroma features, and mel-spectrograms.
Data Preparation and Annotation
- Utilization of datasets such as UrbanSound8K, ESC-50, and custom collections.
- Annotation of sound events and their temporal boundaries.
- Strategies for balancing datasets and audio augmentation.
Building Audio Classification Models
- Application of convolutional neural networks (CNNs) to audio data.
- Model inputs: raw waveforms versus extracted features.
- Selection of loss functions, evaluation metrics, and mitigation of overfitting.
Event Detection and Temporal Localization
- Implementation of frame-based and segment-based detection strategies.
- Post-processing of detections through thresholding and smoothing.
- Visualization of predictions along audio timelines.
Advanced Topics and Real-Time Processing
- Applying transfer learning in low-data scenarios.
- Model deployment using TensorFlow Lite or ONNX.
- Handling streaming audio processing and latency constraints.
Project Development and Application Scenarios
- Designing an end-to-end pipeline from ingestion to classification.
- Creating a proof-of-concept for surveillance, quality control, or monitoring systems.
- Integration of logging, alerting, and connections to dashboards or APIs.
Summary and Next Steps
Requirements
- A solid grasp of machine learning principles and model training workflows.
- Proficiency in Python programming and data preprocessing tasks.
- Basic knowledge of digital audio fundamentals.
Target Audience
- Data scientists.
- Machine learning engineers.
- Researchers and developers specializing in audio signal processing.