Get in Touch
 Duration 21 hours (3 days)

Course Outline

Foundations of Audio Classification

  • Categories of sound events: environmental, mechanical, and human-generated.
  • Overview of key use cases: surveillance, monitoring, and automation.
  • Distinguishing between audio classification, detection, and segmentation.

Audio Data and Feature Extraction

  • Variations in audio file types and formats.
  • Considerations for sampling rates, windowing, and frame sizes.
  • Extraction of MFCCs, chroma features, and mel-spectrograms.

Data Preparation and Annotation

  • Utilization of datasets such as UrbanSound8K, ESC-50, and custom collections.
  • Annotation of sound events and their temporal boundaries.
  • Strategies for balancing datasets and audio augmentation.

Building Audio Classification Models

  • Application of convolutional neural networks (CNNs) to audio data.
  • Model inputs: raw waveforms versus extracted features.
  • Selection of loss functions, evaluation metrics, and mitigation of overfitting.

Event Detection and Temporal Localization

  • Implementation of frame-based and segment-based detection strategies.
  • Post-processing of detections through thresholding and smoothing.
  • Visualization of predictions along audio timelines.

Advanced Topics and Real-Time Processing

  • Applying transfer learning in low-data scenarios.
  • Model deployment using TensorFlow Lite or ONNX.
  • Handling streaming audio processing and latency constraints.

Project Development and Application Scenarios

  • Designing an end-to-end pipeline from ingestion to classification.
  • Creating a proof-of-concept for surveillance, quality control, or monitoring systems.
  • Integration of logging, alerting, and connections to dashboards or APIs.

Summary and Next Steps

Requirements

  • A solid grasp of machine learning principles and model training workflows.
  • Proficiency in Python programming and data preprocessing tasks.
  • Basic knowledge of digital audio fundamentals.

Target Audience

  • Data scientists.
  • Machine learning engineers.
  • Researchers and developers specializing in audio signal processing.

Number of participants


Price per participant

Upcoming Courses

Related Categories