Joint Discriminative Training for Speech Recognition Error Reduction

Resolve Bottlenecks,
Find Innovative Solutions
Generate Solutions

Solution Overview

Problem

Current automatic speech recognition systems face challenges in achieving optimal recognition performance due to limitations in acoustic model training and adaptation, particularly with continuous probability density functions and discriminative training methods, which struggle with distinguishing between correct and incorrect states, and integrating multiple recognition systems for improved performance.

Innovation Solution

Adjusting acoustic model parameters using a joint discriminative criterion across multiple complementary models, employing techniques like Gradient Descent or Extended Baum-Welch algorithms, and combining recognition outputs through methods like Confusion Network Combination or Recognizer Output Voting for Error Reduction, to lower the word error rate by optimizing parameter estimation objectives such as Minimum Classification Error or Maximum Mutual Information Estimation.

Engineering Contradictions & Design Principles

VSEngineering Contradiction Analysis

1Reliability

If maximum likelihood method is used to train acoustic model pdfs, then the model parameters are adjusted to maximize likelihood of observing training data, but recognition performance does not reach optimal level

Engineering Contradiction:
Improverecognition performanceVSAvoidtraining method complexity
Core Design Contradiction:
ReliabilityVSDevice complexity

Solution Approach 1:

The patent transitions from maximum likelihood estimation parameters to discriminative training parameters (Minimum Classification Error, Maximum Mutual Information) to optimize recognition performance. This parameter change in the training objective function directly addresses the limitation of ML not producing optimal recognition performance while maintaining computational feasibility through established optimization algorithms.

Inventive Principle:
Principle #35Parameter changes

2Measurement precision

If discriminative training is used to adjust acoustic model parameters, then recognition errors are minimized, but the ability to distinguish between correct and incorrect states remains limited when vector space distances are similar

Engineering Contradiction:
Improvestate distinction capabilityVSAvoidmodel parameter complexity
Core Design Contradiction:
Measurement precisionVSDevice complexity

Solution Approach 1:

The patent introduces joint discriminative training across multiple acoustic models, adding a dimension of model ensemble comparison. Instead of relying solely on vector space distance within a single model, the system evaluates evidence across multiple models with different parameterizations, effectively adding a dimensional layer to the distinction process between correct and incorrect states.

Inventive Principle:
Principle #17Another dimension (Dimensionality change)

Solution Approach 2:

The patent combines multiple acoustic models with different training criteria (ML, MCE, MMI) into a composite recognition system. Each model acts as a component with different characteristics, and their combined evidence provides more robust state distinction capability than any single model alone, analogous to composite materials combining properties of constituent materials.

Inventive Principle:
Principle #40Composite materials

3Reliability

If multiple speech recognition processes are combined, then overall recognition performance is improved, but integration complexity and computational requirements increase

Engineering Contradiction:
Improveoverall recognition performanceVSAvoidsystem integration complexity
Core Design Contradiction:
ReliabilityVSDevice complexity

Solution Approach 1:

The patent merges multiple acoustic models into a unified joint discriminative training framework. Rather than separately training and combining multiple independent recognition processes, the approach integrates them at the training stage with a joint objective function, reducing integration complexity while maintaining the performance benefits of multiple models.

Inventive Principle:
Principle #5Merging (Combining)

Solution Approach 2:

The patent creates a universal training framework that can accommodate multiple acoustic models with different characteristics and training criteria. The joint discriminative criterion serves multiple functions: it trains individual models, coordinates their interactions, and optimizes their combined performance, reducing the need for separate integration mechanisms.

Inventive Principle:
Principle #6Universality (Multi-functionality)

Data Source

PatentUS8843370B2Joint discriminative training of multiple speech recognizers
Publication Date: 2014.09.23 MICROSOFT TECHNOLOGY LICENSING LLC
  • US8843370B2 patent drawing
  • US8843370B2 patent drawing
  • US8843370B2 patent drawing

AI summary

Adjusting model parameters is described for a speech recognition system that combines recognition outputs from multiple speech recognition processes. Discriminative adjustments are made to model parameters of at least one acoustic model based on a joint discriminative criterion over multiple complementary acoustic models to lower recognition word error rate in the system.