Audio Library Filtering via Perceptive Distribution Binning
Find Innovative SolutionsGenerate Solutions
Solution Overview
Problem
Current methods for filtering and sorting large audio libraries rely on traditional metadata, which is not reliable, discrete, and lacks continuous information, making it difficult to sort music based on perceptually relevant features like intensity or tempo, as these features are not standardized and often reflect recording quality rather than musical characteristics.
Innovation Solution
The system processes audio files using objective audio processing metrics like loudness, pitch, and spectral flux to generate composite metrics that align with human perception, allowing for continuous sorting and filtering based on features like Fast/Slow, Bass/Treble, and Smooth/Rough, by combining multiple metrics into a single value and using distribution binning to create a consistent and predictable filtering experience.
Engineering Contradictions & Design Principles
Engineering Contradiction Analysis
1Ease of operation
If traditional metadata is used for filtering and sorting, then the system is simple and easy to implement, but the filtering capability is insufficient and cannot provide continuous sorting based on perceptual features
Solution Approach 1:
The patent segments audio features into multiple distribution bins based on perceptual characteristics. Each bin represents a range of values for features like tempo, energy, danceability, etc., allowing continuous sorting and filtering. This segmentation enables fine-grained control over filtering capabilities while maintaining system manageability through modular bin structures.
Solution Approach 2:
The patent transitions from discrete metadata categories to continuous perceptual dimensions by introducing distribution bins along multiple audio feature axes. This dimensional approach allows users to filter and sort along continuous spectra (e.g., from slow to fast tempos, from low to high energy) rather than discrete categories, significantly enhancing filtering capability.
2Measurement precision
If multiple objective audio metrics are processed and combined into composite metrics with distribution binning, then perceptual accuracy and filtering precision are improved, but processing time and computational resources increase
Solution Approach 1:
The patent performs preliminary processing by pre-computing distribution bins for multiple audio features and storing them in a structured format. This pre-computation allows subsequent filtering and sorting operations to efficiently query pre-established bins rather than computing features from scratch, significantly reducing processing time while maintaining high perceptual accuracy.
Solution Approach 2:
The patent merges multiple objective audio metrics (tempo, energy, danceability, valence, etc.) into composite perceptual metrics by combining their distribution bins. This merging process creates unified perceptual representations that capture complex audio characteristics while optimizing processing efficiency through integrated bin structures.
3Adaptability or versatility
If continuous audio features are extracted and standardized, then sorting and filtering based on perceptual characteristics becomes possible, but reliability and consistency of feature extraction become challenging
Solution Approach 1:
The patent applies parameter transformations to standardize audio features into consistent distribution bins. By normalizing features like tempo, energy, and danceability into standardized perceptual ranges, the system achieves reliable and consistent feature extraction across diverse audio inputs, enabling accurate sorting and filtering based on perceptual characteristics.
4Manufacturing precision
If distribution binning is applied to multiple audio features, then filtering precision and user control are enhanced, but the complexity of metric calculation and bin management increases
Solution Approach 1:
The patent creates a universal distribution binning framework that can be applied across multiple audio features (tempo, energy, danceability, valence, etc.) using a consistent methodology. This universal approach simplifies metric calculation complexity by reusing the same binning logic and data structures across different features, while still achieving high filtering precision through multi-dimensional bin combinations.
Data Source
AI summary
System and methods for filtering and sorting libraries of audio data and quantitatively processing audio data to generate metrics for use in filtering and sorting methods based on distribution bins that are, for example, derived using human listening perception. Examples include calculating composite metrics based on values of objective audio metrics for individual audio files of a large audio library, each objective audio metrics generating a distribution of values. Examples include assigning three or more bins for each value of the objective audio metrics such that the bins represent perceptually distinct groups and, for each composite metric, combining the bins of each objective audio metric of the composite metric to generate corresponding distribution bins of the values of the composite metric for the large audio library. Examples include filtering the large audio library using corresponding distribution bins for a plurality of distinct composite metrics.


