Gaze-Region Video Processing for Accurate Recognition with Lower Data Volume

Resolve Bottlenecks,
Find Innovative Solutions
Generate Solutions

Solution Overview

Problem

Existing video processing systems face challenges in improving recognition accuracy while minimizing data transmission, as high compression rates or data loss lead to erroneous recognition.

Innovation Solution

A video processing system that controls image quality of a gaze region, performs recognition processing, predicts the position of the gaze target in subsequent videos, and determines the gaze region for quality control based on the predicted position, thereby enhancing recognition accuracy while reducing data volume.

Engineering Contradictions & Design Principles

VSEngineering Contradiction Analysis

1Measurement precision

If image quality is improved for recognition processing, then recognition accuracy is improved, but data transmission volume increases

Engineering Contradiction:
Improverecognition accuracyVSAvoiddata transmission volume
Core Design Contradiction:
Measurement precisionVSQuantity of substance

Solution Approach 1:

The patent applies local quality by selectively improving image quality only in the gaze region (region of interest) while maintaining lower quality in other regions. This is achieved through region-of-interest (ROI) based image processing where the gaze target area is identified and enhanced with higher resolution and less compression, while non-gaze areas are transmitted with lower quality to reduce overall data volume.

Inventive Principle:
Principle #3Local quality

2Quantity of substance

If compression rate is increased to reduce data transmission, then data transmission volume is reduced, but recognition accuracy deteriorates

Engineering Contradiction:
Improvedata transmission volumeVSAvoidrecognition accuracy
Core Design Contradiction:
Quantity of substanceVSMeasurement precision

Solution Approach 1:

Different compression rates are applied to different regions of the video. The gaze region maintains lower compression to preserve recognition accuracy, while non-gaze regions use higher compression to reduce data transmission volume. This selective compression strategy resolves the contradiction by localizing quality requirements.

Inventive Principle:
Principle #3Local quality

Solution Approach 2:

The video frame is segmented into gaze region and non-gaze region based on detected gaze targets. This segmentation allows independent processing of each region with appropriate compression levels, enabling the system to reduce overall data volume while maintaining accuracy in critical areas.

Inventive Principle:
Principle #1Segmentation

3Measurement precision

If high quality video is transmitted for all regions, then recognition accuracy is improved, but network bandwidth consumption increases

Engineering Contradiction:
Improverecognition accuracyVSAvoidnetwork bandwidth consumption
Core Design Contradiction:
Measurement precisionVSLoss of energy

Solution Approach 1:

The system transmits high quality video data only for the gaze region where recognition processing is performed, while transmitting lower quality data for other regions. This localized quality approach significantly reduces network bandwidth consumption while maintaining sufficient quality for recognition tasks in the critical gaze area.

Inventive Principle:
Principle #3Local quality

Data Source

PatentUS20250239068A1Video processing system, video processing method, and video processing apparatus
Publication Date: 2025.07.24 NEC CORP
  • US20250239068A1 patent drawing
  • US20250239068A1 patent drawing
  • US20250239068A1 patent drawing

AI summary

A video processing system (10) includes an image quality control unit (11) that controls an image quality of a gaze region including a gaze target in an input video, a recognition unit (12) that performs recognition processing of recognizing the gaze target on the video in which the image quality of the gaze region is controlled, a prediction unit (13) that predicts a position of the gaze target in a video subsequent to the video on which the recognition processing has been performed, based on extraction information extracted from the recognition processing, and a determination unit (14) that determines the gaze region for which the image quality control means (11) controls an image quality in the subsequent video, based on the predicted position of the gaze target.