Voiceprint Feature Fusion via Linear Discriminant Analysis

Resolve Bottlenecks,
Find Innovative Solutions
Generate Solutions

Solution Overview

Problem

Existing voiceprint feature fusion methods are too simplistic, resulting in non-discriminative features that do not fully consider the complementarity and discrimination of fused features, leading to inadequate performance in speaker verification.

Innovation Solution

A method and apparatus that fuse voiceprint features using linear discriminant analysis (LDA) and probabilistic linear discriminant analysis (PLDA), combining i-vector, x-vector, and d-vector features extracted through a universal background model and deep neural networks, to enhance the complementarity and discrimination of voiceprint features.

Engineering Contradictions & Design Principles

VSEngineering Contradiction Analysis

1Measurement precision

If simple voiceprint feature fusion methods are used, then the device complexity is reduced, but the recognition accuracy and discrimination performance deteriorate

Engineering Contradiction:
Improverecognition accuracyVSAvoidfeature fusion complexity
Core Design Contradiction:
Measurement precisionVSDevice complexity

Solution Approach 1:

The patent transforms voiceprint features from different extraction methods (i-vector, x-vector, d-vector) into a unified discriminative feature space by changing the parameter representation through LDA transformation. This allows features with different original parameter structures to be fused effectively while maintaining high recognition accuracy.

Inventive Principle:
Principle #35Parameter changes

Solution Approach 2:

The patent applies linear discriminant analysis to project features from multiple sources into a new dimensional space that maximizes between-class separation and minimizes within-class variation. This dimensionality transformation enables effective fusion of heterogeneous voiceprint features while improving discrimination performance.

Inventive Principle:
Principle #17Another dimension (Dimensionality change)

2Reliability

If multiple voiceprint features are fused without proper analysis, then the quantity of features increases, but the complementarity and discrimination of fused features deteriorate

Engineering Contradiction:
Improvespeaker verification performanceVSAvoidfeature complementarity
Core Design Contradiction:
ReliabilityVSLoss of information

Solution Approach 1:

The patent changes the parameter representation of fused features by applying LDA transformation, which reconfigures the feature parameters to maximize discriminative power. This ensures that the fused features maintain and enhance their complementarity rather than losing it through simple concatenation or averaging.

Inventive Principle:
Principle #35Parameter changes

Solution Approach 2:

The patent replaces simple mechanical fusion methods (such as direct concatenation or averaging) with a more sophisticated statistical approach (LDA-based fusion). This substitution transforms the fusion process from a straightforward combination to an optimized integration that preserves and enhances feature complementarity.

Inventive Principle:
Principle #28Mechanics substitution (Replace mechanical system)

3Measurement precision

If linear discriminant analysis is applied for feature fusion, then the discrimination of fused features is improved, but the computational complexity increases

Engineering Contradiction:
Improvefeature discriminationVSAvoidcomputational complexity
Core Design Contradiction:
Measurement precisionVSDevice complexity

Solution Approach 1:

The patent applies LDA transformation to change the parameter space of fused features, computing optimal projection directions that maximize discrimination. While this increases computational complexity compared to simple fusion, it provides a mathematically optimal solution for feature discrimination that significantly improves speaker verification performance.

Inventive Principle:
Principle #35Parameter changes

Data Source

PatentUS11875799B2Method and device for fusing voiceprint features, voice recognition method and system, and storage medium
Publication Date: 2024.01.16 SOUNDAI TECH CO LTD
  • US11875799B2 patent drawing
  • US11875799B2 patent drawing
  • US11875799B2 patent drawing

AI summary

A method and device for fusing voiceprint features. The method includes: obtaining at least two voiceprint features of a voice sample of a target speaker (S3; S4); fusing the at least two voiceprint features on the basis of linear discriminant analysis (S5). The present method introduces a technique employing linear discriminant analysis to fuse various voiceprint features, so as to improve complementarities between the various voiceprint features and distinctions between the fused features, thereby increasing the recognition rate for target speakers and reducing the misrecognition rate for non-target speakers in voiceprint authentication scenarios, and providing personalized and improved user experience.