Speech Recognition Accuracy Deterioration Factor Estimation

Resolve Bottlenecks,
Find Innovative Solutions
Generate Solutions

Solution Overview

Problem

Existing speech recognition systems are limited in detecting and correcting acoustic factors leading to speech recognition errors, as they primarily focus on linguistic errors and unknown words, failing to effectively estimate and address acoustic factors that degrade recognition accuracy.

Innovation Solution

A speech recognition accuracy degradation factor estimation device comprising an acoustic feature extraction unit, posterior probability calculation unit, filtering unit, speech recognition unit, speech recognition result feature extraction unit, and degradation factor output unit, which extracts and filters acoustic features to identify and output the main degradation factor class affecting speech recognition accuracy.

Engineering Contradictions & Design Principles

VSEngineering Contradiction Analysis

1Measurement precision

If existing speech recognition systems focus on detecting and correcting linguistic errors and unknown words, then linguistic error correction is improved, but acoustic factor estimation capability deteriorates

Engineering Contradiction:
Improvelinguistic error detection accuracyVSAvoidacoustic factor estimation capability
Core Design Contradiction:
Measurement precisionVSAdaptability or versatility

Solution Approach 1:

The speech recognition system is enhanced with multi-functionality by integrating both linguistic error detection capabilities and acoustic factor estimation capabilities into a single unified system. The acoustic feature quantity extraction unit, posterior probability calculation unit, and degradation factor output unit work together to provide comprehensive error analysis that covers both linguistic and acoustic dimensions, allowing the system to address multiple types of recognition errors simultaneously.

Inventive Principle:
Principle #6Universality (Multi-functionality)

Solution Approach 2:

The error detection and analysis function is segmented into distinct specialized units: the acoustic feature quantity extraction unit separates acoustic analysis from linguistic analysis, the posterior probability calculation unit independently evaluates acoustic event probabilities, and the degradation factor output unit specifically identifies acoustic degradation factors. This segmentation allows each unit to specialize in its specific function while contributing to the overall error correction system.

Inventive Principle:
Principle #1Segmentation

2Measurement precision

If speech recognition systems use parallel phoneme and word recognition to detect unknown words, then unknown word detection is improved, but comprehensive error analysis capability deteriorates

Engineering Contradiction:
Improveunknown word detection accuracyVSAvoiderror analysis comprehensiveness
Core Design Contradiction:
Measurement precisionVSDevice complexity

Solution Approach 1:

The posterior probability calculation unit serves as an intermediary that bridges acoustic feature extraction and speech recognition results. It calculates posterior probabilities of acoustic events based on extracted acoustic features and preliminarily classified acoustic events, providing a probabilistic assessment that feeds into the degradation factor output unit. This intermediary component enables comprehensive error analysis by connecting acoustic analysis with recognition outcomes without requiring complete system redesign.

Inventive Principle:
Principle #24Intermediary (Mediator)

3Productivity

If speech recognition systems typify error patterns and correct corresponding portions, then linguistic pattern correction is improved, but acoustic error handling capability deteriorates

Engineering Contradiction:
Improvelinguistic error correction efficiencyVSAvoidacoustic error handling reliability
Core Design Contradiction:
ProductivityVSReliability

Solution Approach 1:

The system changes the parameter being analyzed from purely linguistic patterns to include acoustic parameters. The acoustic feature quantity extraction unit extracts acoustic features such as pitch, energy, and spectral characteristics, while the degradation factor output unit identifies acoustic degradation factors based on these parameters. This parameter expansion allows the system to handle acoustic errors reliably by analyzing acoustic properties rather than relying solely on linguistic pattern matching.

Inventive Principle:
Principle #35Parameter changes

Data Source

PatentUS11227580B2Speech recognition accuracy deterioration factor estimation device, speech recognition accuracy deterioration factor estimation method, and program
Publication Date: 2022.01.18 NIPPON TELEGRAPH & TELEPHONE CORP
  • US11227580B2 patent drawing
  • US11227580B2 patent drawing
  • US11227580B2 patent drawing

AI summary

The present invention provides a device for estimating the deterioration factor of speech recognition accuracy by estimating an acoustic factor that leads to a speech recognition error. The device extracts an acoustic feature amount for each frame from an input speech, calculates a posterior probability for each acoustic event for the acoustic feature amount for each frame, corrects the posterior probability by filtering the posterior probability for each acoustic event using a time-series filter with weighting coefficients developed in the time axis, outputs a set of speech recognition results with a recognition score, outputs a feature amount for the speech recognition results for each frame, calculates and outputs a principal deterioration factor class for the speech recognition accuracy for each frame on the basis of the corrected posterior probability, the feature amount for speech recognition results for each frame, and the acoustic feature amount for each frame.