Structural Similarity Divisive Normalization for Video Coding

Resolve Bottlenecks,
Find Innovative Solutions
Generate Solutions

Solution Overview

Problem

Existing video coding techniques fail to effectively balance data rate and perceptual video quality, as they rely on poor correlation metrics such as mean squared error and peak signal-to-noise ratio, which do not accurately represent human visual perception.

Innovation Solution

A method utilizing a structural similarity-based divisive normalization mechanism for video coding, which normalizes coefficients using adaptive divisive normalization factors to improve rate-distortion optimization and entropy coding, ensuring better perceptual quality without increasing data rate.

Engineering Contradictions & Design Principles

VSEngineering Contradiction Analysis

1Measurement precision

If traditional video coding techniques using MSE or PSNR are used, then computational simplicity is maintained, but perceptual video quality correlation is poor

Engineering Contradiction:
Improveperceptual video quality correlationVSAvoidcoding mechanism complexity
Core Design Contradiction:
Measurement precisionVSDevice complexity

Solution Approach 1:

The patent transforms the coding approach by changing the distortion metric parameter from MSE/PSNR to SSIM-based measurement. This parameter change enables the system to achieve better perceptual quality correlation by using structural similarity metrics that align with human visual perception, resolving the contradiction between measurement precision and computational complexity through a more perceptually relevant parameter selection.

Inventive Principle:
Principle #35Parameter changes

Solution Approach 2:

The patent applies preliminary action by pre-computing normalization factors based on statistical properties of the video content before actual coding. This preliminary computation of normalization factors allows the main coding process to use these pre-derived values, reducing the real-time computational burden while maintaining the perceptual quality benefits of the SSIM-based approach.

Inventive Principle:
Principle #10Preliminary action

2Productivity

If data rate is reduced through compression, then transmission efficiency is improved, but perceptual video quality deteriorates

Engineering Contradiction:
Improvetransmission efficiencyVSAvoidperceptual video quality
Core Design Contradiction:
ProductivityVSMeasurement precision

Solution Approach 1:

The patent changes the optimization parameter from traditional rate-distortion using MSE to rate-SSIM optimization. By using SSIM as the distortion metric in the rate-distortion framework, the system can achieve better perceptual quality at reduced bitrates because the optimization process explicitly targets structural similarity preservation rather than simple pixel-wise error minimization.

Inventive Principle:
Principle #35Parameter changes

Solution Approach 2:

The patent introduces dynamic adaptation by computing normalization factors that adapt to local video content characteristics. This dynamic approach allows the coding system to allocate bits more efficiently across different regions and frames based on actual perceptual importance, improving transmission efficiency while maintaining perceptual quality through content-aware rate control.

Inventive Principle:
Principle #15Dynamics

3Measurement precision

If SSIM-based optimization is implemented, then perceptual quality is improved, but computational complexity increases

Engineering Contradiction:
Improveperceptual quality prediction accuracyVSAvoidcoding algorithm complexity
Core Design Contradiction:
Measurement precisionVSDevice complexity

Solution Approach 1:

The patent reduces computational complexity through preliminary action by pre-computing normalization factors based on statistical properties (mean and standard deviation) of the video content before the main coding process. These pre-computed factors are then reused during encoding, significantly reducing the real-time computational burden while maintaining the perceptual quality benefits of SSIM-based optimization.

Inventive Principle:
Principle #10Preliminary action

Solution Approach 2:

The system uses self-service by computing normalization factors from the video content's own statistical properties (local mean and standard deviation) without requiring external reference data or complex models. This self-contained approach allows the system to adapt to local content characteristics while maintaining computational efficiency through simple statistical computations.

Inventive Principle:
Principle #25Self-service

Data Source

PatentUS10021383B2Method and system for structural similarity based perceptual video coding
Publication Date: 2018.07.10 IMAX CORP
  • US10021383B2 patent drawing
  • US10021383B2 patent drawing
  • US10021383B2 patent drawing

AI summary

The present invention is a system and method for video coding. The video coding system may involve a structural similarity-based divisive normalization approach, wherein the frame prediction residual of the current frame may be transformed to form a set of coefficients and a divisive normalization mechanism may be utilized to normalize each coefficient. The normalization factor may be designed to reflect or approximate the normalization factor in a structural similarity definition. The Lagrange parameter for RDO for divisive normalization coefficients may be determined by both the quantization step and a prior distribution function of the coefficients. The present invention may generally be utilized to improve the perceptual quality of decoded video without increasing data rate, or to reduce the data rate of compressed video stream without sacrificing the perceived quality of decoded video. The present invention has shown to significantly improve the coding efficiency of MPEG4/H.264 AVC and HEVC coding schemes. The present invention may be utilized to create video codes compatible with prior art and state-of-the-art video coding standards such as MPEG4/H.264 AVC and HEVC. The present invention may also be utilized to create video codecs incompatible with existing standards, so as to further improve the coding gain.