Joint Discriminative Training for Speech Recognition Error Reduction
Find Innovative SolutionsGenerate Solutions
Solution Overview
Problem
Current automatic speech recognition systems face challenges in achieving optimal recognition performance due to limitations in acoustic model training and adaptation, particularly with continuous probability density functions and discriminative training methods, which struggle with distinguishing between correct and incorrect states, and integrating multiple recognition systems for improved performance.
Innovation Solution
Adjusting acoustic model parameters using a joint discriminative criterion across multiple complementary models, employing techniques like Gradient Descent or Extended Baum-Welch algorithms, and combining recognition outputs through methods like Confusion Network Combination or Recognizer Output Voting for Error Reduction, to lower the word error rate by optimizing parameter estimation objectives such as Minimum Classification Error or Maximum Mutual Information Estimation.
Engineering Contradictions & Design Principles
Engineering Contradiction Analysis
1Reliability
If maximum likelihood method is used to train acoustic model pdfs, then the model parameters are adjusted to maximize likelihood of observing training data, but recognition performance does not reach optimal level
Solution Approach 1:
The patent transitions from maximum likelihood estimation parameters to discriminative training parameters (Minimum Classification Error, Maximum Mutual Information) to optimize recognition performance. This parameter change in the training objective function directly addresses the limitation of ML not producing optimal recognition performance while maintaining computational feasibility through established optimization algorithms.
2Measurement precision
If discriminative training is used to adjust acoustic model parameters, then recognition errors are minimized, but the ability to distinguish between correct and incorrect states remains limited when vector space distances are similar
Solution Approach 1:
The patent introduces joint discriminative training across multiple acoustic models, adding a dimension of model ensemble comparison. Instead of relying solely on vector space distance within a single model, the system evaluates evidence across multiple models with different parameterizations, effectively adding a dimensional layer to the distinction process between correct and incorrect states.
Solution Approach 2:
The patent combines multiple acoustic models with different training criteria (ML, MCE, MMI) into a composite recognition system. Each model acts as a component with different characteristics, and their combined evidence provides more robust state distinction capability than any single model alone, analogous to composite materials combining properties of constituent materials.
3Reliability
If multiple speech recognition processes are combined, then overall recognition performance is improved, but integration complexity and computational requirements increase
Solution Approach 1:
The patent merges multiple acoustic models into a unified joint discriminative training framework. Rather than separately training and combining multiple independent recognition processes, the approach integrates them at the training stage with a joint objective function, reducing integration complexity while maintaining the performance benefits of multiple models.
Solution Approach 2:
The patent creates a universal training framework that can accommodate multiple acoustic models with different characteristics and training criteria. The joint discriminative criterion serves multiple functions: it trains individual models, coordinates their interactions, and optimizes their combined performance, reducing the need for separate integration mechanisms.
Data Source
AI summary
Adjusting model parameters is described for a speech recognition system that combines recognition outputs from multiple speech recognition processes. Discriminative adjustments are made to model parameters of at least one acoustic model based on a joint discriminative criterion over multiple complementary acoustic models to lower recognition word error rate in the system.


