Neural Network Phrase Recognition Quality Prediction

Resolve Bottlenecks,
Find Innovative Solutions
Generate Solutions

Solution Overview

Problem

Existing automatic speech recognition (ASR) systems face challenges in predicting the recognition quality of phrases, requiring time-consuming and computationally intensive processes to analyze audio recordings, which can be inefficient and dependent on user expertise.

Innovation Solution

A system and method using a neural network-based prediction model that computes recognition quality by analyzing features such as precision, recall, and language models, allowing users to predict phrase recognition quality before actual recognition, thereby reducing the need for extensive audio analysis.

Engineering Contradictions & Design Principles

VSEngineering Contradiction Analysis

1Measurement precision

If audio recordings are analyzed to predict phrase recognition quality, then recognition quality assessment is achieved, but the process becomes time-consuming and computationally intensive

Engineering Contradiction:
Improverecognition quality assessmentVSAvoidprediction time
Core Design Contradiction:
Measurement precisionVSLoss of time

Solution Approach 1:

The system performs preliminary analysis by extracting acoustic features and language model probabilities before final recognition quality determination. This preliminary action prepares data in advance, allowing faster prediction when actual phrase recognition is needed, thus reducing the time loss without compromising assessment accuracy.

Inventive Principle:
Principle #10Preliminary action

Solution Approach 2:

The patent introduces intermediary components including acoustic feature extractors, language model probability calculators, and trained classifiers that mediate between raw audio data and recognition quality assessment. These intermediaries process and transform data into meaningful features, reducing the computational burden on the final prediction step while maintaining high measurement precision.

Inventive Principle:
Principle #24Intermediary (Mediator)

2Measurement precision

If audio recordings are analyzed to predict phrase recognition quality, then recognition quality assessment is achieved, but computational resources are heavily consumed

Engineering Contradiction:
Improverecognition quality assessmentVSAvoidcomputational resources
Core Design Contradiction:
Measurement precisionVSUse of energy by moving object

Solution Approach 1:

The system extracts only the most relevant acoustic features and language model probabilities needed for recognition quality prediction, rather than processing entire audio recordings. This extraction approach isolates critical information while discarding redundant data, significantly reducing computational resource consumption while preserving assessment accuracy.

Inventive Principle:
Principle #2Taking out (Extraction)

Solution Approach 2:

The patent transforms audio data into different parameter representations including acoustic features (energy, zero-crossing rate, spectral characteristics) and language model probabilities. These parameter changes convert raw audio into compact, informative representations that require fewer computational resources to process while maintaining high measurement precision for recognition quality assessment.

Inventive Principle:
Principle #35Parameter changes

3Ease of operation

If users manually input phrases based on expertise, then phrase selection is made, but the process depends on user expertise and is difficult to predict recognition quality

Engineering Contradiction:
Improvephrase selectionVSAvoidrecognition quality prediction
Core Design Contradiction:
Ease of operationVSReliability

Solution Approach 1:

The system performs self-service by automatically evaluating phrase recognition quality using trained classifiers and acoustic features, eliminating the need for users to have specialized expertise. The automated system objectively assesses each phrase's recognition quality based on acoustic characteristics and language model probabilities, making the process easier to operate while improving reliability through consistent, data-driven evaluation.

Inventive Principle:
Principle #25Self-service

Solution Approach 2:

The patent implements feedback mechanisms where the system provides predicted recognition quality scores for user-input phrases, allowing users to iteratively refine their phrase selections. This feedback loop enables non-experts to make informed decisions by seeing predicted quality metrics, thereby improving both ease of operation and reliability of phrase selection without requiring specialized user expertise.

Inventive Principle:
Principle #23Feedback

Data Source

PatentUS10319366B2Predicting recognition quality of a phrase in automatic speech recognition systems
Publication Date: 2019.06.11 GENESYS CLOUD SERVICES INC
  • US10319366B2 patent drawing
  • US10319366B2 patent drawing
  • US10319366B2 patent drawing

AI summary

A method for predicting a speech recognition quality of a phrase comprising at least one word includes: receiving, on a computer system including a processor and memory storing instructions, the phrase; computing, on the computer system, a set of features comprising one or more features corresponding to the phrase; providing the phrase to a prediction model on the computer system and receiving a predicted recognition quality value based on the set of features; and returning the predicted recognition quality value.