Voiceprint Feature Fusion via Linear Discriminant Analysis
Find Innovative SolutionsGenerate Solutions
Solution Overview
Problem
Existing voiceprint feature fusion methods are too simplistic, resulting in non-discriminative features that do not fully consider the complementarity and discrimination of fused features, leading to inadequate performance in speaker verification.
Innovation Solution
A method and apparatus that fuse voiceprint features using linear discriminant analysis (LDA) and probabilistic linear discriminant analysis (PLDA), combining i-vector, x-vector, and d-vector features extracted through a universal background model and deep neural networks, to enhance the complementarity and discrimination of voiceprint features.
Engineering Contradictions & Design Principles
Engineering Contradiction Analysis
1Measurement precision
If simple voiceprint feature fusion methods are used, then the device complexity is reduced, but the recognition accuracy and discrimination performance deteriorate
Solution Approach 1:
The patent transforms voiceprint features from different extraction methods (i-vector, x-vector, d-vector) into a unified discriminative feature space by changing the parameter representation through LDA transformation. This allows features with different original parameter structures to be fused effectively while maintaining high recognition accuracy.
Solution Approach 2:
The patent applies linear discriminant analysis to project features from multiple sources into a new dimensional space that maximizes between-class separation and minimizes within-class variation. This dimensionality transformation enables effective fusion of heterogeneous voiceprint features while improving discrimination performance.
2Reliability
If multiple voiceprint features are fused without proper analysis, then the quantity of features increases, but the complementarity and discrimination of fused features deteriorate
Solution Approach 1:
The patent changes the parameter representation of fused features by applying LDA transformation, which reconfigures the feature parameters to maximize discriminative power. This ensures that the fused features maintain and enhance their complementarity rather than losing it through simple concatenation or averaging.
Solution Approach 2:
The patent replaces simple mechanical fusion methods (such as direct concatenation or averaging) with a more sophisticated statistical approach (LDA-based fusion). This substitution transforms the fusion process from a straightforward combination to an optimized integration that preserves and enhances feature complementarity.
3Measurement precision
If linear discriminant analysis is applied for feature fusion, then the discrimination of fused features is improved, but the computational complexity increases
Solution Approach 1:
The patent applies LDA transformation to change the parameter space of fused features, computing optimal projection directions that maximize discrimination. While this increases computational complexity compared to simple fusion, it provides a mathematically optimal solution for feature discrimination that significantly improves speaker verification performance.
Data Source
AI summary
A method and device for fusing voiceprint features. The method includes: obtaining at least two voiceprint features of a voice sample of a target speaker (S3; S4); fusing the at least two voiceprint features on the basis of linear discriminant analysis (S5). The present method introduces a technique employing linear discriminant analysis to fuse various voiceprint features, so as to improve complementarities between the various voiceprint features and distinctions between the fused features, thereby increasing the recognition rate for target speakers and reducing the misrecognition rate for non-target speakers in voiceprint authentication scenarios, and providing personalized and improved user experience.


