Communication Session Quality Assessment via Audio Text Conversion

Resolve Bottlenecks,
Find Innovative Solutions
Generate Solutions

Solution Overview

Problem

Assessing the quality of communication sessions in a 1-to-many mode, such as online lectures, is challenging due to the diversity of listeners, content, speakers, hardware, and software platforms involved, leading to a need for a holistic assessment of semantic information transmission.

Innovation Solution

An apparatus and method for assessing communication session quality by continuously receiving and converting audio streams into text data, determining quality features like understandability, information quality, and attention, and providing feedback to improve user experience.

Engineering Contradictions & Design Principles

VSEngineering Contradiction Analysis

1Measurement precision

If multiple quality features are monitored to provide holistic assessment, then assessment comprehensiveness is improved, but system complexity increases

Engineering Contradiction:
Improveassessment comprehensivenessVSAvoidsystem complexity
Core Design Contradiction:
Measurement precisionVSDevice complexity

Solution Approach 1:

The quality assessment system is divided into multiple independent quality feature modules (articulation quality, grammar quality, information quality, attention quality, feedback quality) that can be processed separately and then integrated. Each module focuses on a specific aspect of communication quality, making the overall complex system manageable through modular decomposition.

Inventive Principle:
Principle #1Segmentation

Solution Approach 2:

The system employs a multi-functional apparatus that simultaneously performs speech-to-text conversion, quality feature extraction, audio stream analysis, and feedback generation. This universal system handles diverse quality assessment tasks through integrated processing of audio streams and text data across multiple quality dimensions.

Inventive Principle:
Principle #6Universality (Multi-functionality)

2Ease of operation

If real-time monitoring and feedback are implemented, then user experience improvement is enhanced, but processing time and computational resources increase

Engineering Contradiction:
Improveuser experienceVSAvoidprocessing time
Core Design Contradiction:
Ease of operationVSLoss of time

Solution Approach 1:

The system performs preliminary speech-to-text conversion and quality feature extraction during the communication session itself, rather than analyzing recordings afterward. By preparing and analyzing data in real-time as it is generated, the system enables immediate feedback without significant post-processing delays.

Inventive Principle:
Principle #10Preliminary action

Solution Approach 2:

The system implements continuous feedback loops where quality features are monitored in real-time and feedback is provided to users during the communication session. This allows speakers to immediately adjust their delivery based on articulation, grammar, information quality, and attention metrics, improving user experience through timely interventions.

Inventive Principle:
Principle #23Feedback

Data Source

PatentUS12211495B2Assessment of the quality of a communication session over a telecommunication network
Publication Date: 2025.01.28 BULL SA
  • US12211495B2 patent drawing
  • US12211495B2 patent drawing
  • US12211495B2 patent drawing

AI summary

Apparatus (5) for assessing a quality of a communication session (3) between at least one first party (1) and at least one second party (2a, 2b . . . 2N), over a telecommunication network (4), comprising means for:monitoring (S1) said communication session by continuously receiving an audio stream associated with said communication session;converting (S2) language of said audio stream into text data;determining (S3), from said text data, at least first understandability quality features (UQFA, UQFG) and an information quality feature (IQF), said first understandability quality feature being representative of at least word articulation and grammar correctness within said language, and said information quality feature being representative of a comparison of the semantic content of said audio stream with a set of contents related to said audio stream;assessing (S4) said quality from said quality features.