Post-Training Quantization Model Selection via Indirect Metrics

Resolve Bottlenecks,
Find Innovative Solutions
Generate Solutions

Solution Overview

Problem

The process of finding optimal post-training quantization (PTQ) options for neural network models is time-consuming and requires significant effort due to the need for manual exploration of different precision settings, quantization error minimization algorithms, and calibration schemes, which vary across models and datasets.

Innovation Solution

A method that converts and optimizes a floating-point machine learning model, applies multiple PTQ settings to generate various PTQ models, and evaluates them using predetermined indirect metrics to automatically find the optimal PTQ model, thereby reducing the need for manual exploration and minimizing redundant operations.

Engineering Contradictions & Design Principles

VSEngineering Contradiction Analysis

1Measurement precision

If manual exploration is used to find optimal PTQ options, then model accuracy can be optimized, but time consumption and effort increase significantly

Engineering Contradiction:
Improvemodel accuracyVSAvoidtime consumption
Core Design Contradiction:
Measurement precisionVSLoss of time

Solution Approach 1:

The system performs self-evaluation by automatically computing indirect metrics (SQNR, MAE, cosine similarity) for multiple PTQ configurations and selecting the optimal model without requiring manual exploration or external evaluation, thereby reducing time consumption while maintaining accuracy optimization

Inventive Principle:
Principle #25Self-service

Solution Approach 2:

The system changes evaluation parameters by using indirect metrics (signal-to-quantization-noise ratio, mean absolute error, cosine similarity) instead of direct model accuracy evaluation, enabling automated comparison and selection of PTQ models without time-consuming manual testing

Inventive Principle:
Principle #35Parameter changes

2Manufacturing precision

If multiple PTQ settings are evaluated to find optimal settings, then quantized model quality improves, but the complexity of the process increases

Engineering Contradiction:
Improvequantized model qualityVSAvoidprocess complexity
Core Design Contradiction:
Manufacturing precisionVSDevice complexity

Solution Approach 1:

The evaluation process is segmented into three independent categories (precision setting, quantization error minimization algorithm, calibration scheme), allowing systematic exploration of PTQ options while maintaining organized and manageable complexity through structured comparison

Inventive Principle:
Principle #1Segmentation

Solution Approach 2:

Indirect metrics serve as intermediaries that simplify the comparison of different PTQ models by providing computable proxies (SQNR, MAE, cosine similarity) that correlate with model quality without requiring complex direct accuracy evaluation for each configuration

Inventive Principle:
Principle #24Intermediary (Mediator)

3Productivity

If automated evaluation is implemented, then time and effort are reduced, but the need for accurate indirect metrics increases

Engineering Contradiction:
Improveevaluation efficiencyVSAvoidmetric accuracy
Core Design Contradiction:
ProductivityVSMeasurement precision

Solution Approach 1:

The indirect metrics (signal-to-quantization-noise ratio, mean absolute error, cosine similarity) serve multiple functions simultaneously: they are computationally efficient for automated evaluation, provide accurate proxies for model quality, and work across different PTQ configurations and model types, enabling universal application

Inventive Principle:
Principle #6Universality (Multi-functionality)

Data Source

PatentUS20250021827A1Method for finding at least one optimal post-training quantization model and a non-transitory machine-readable medium
Publication Date: 2025.01.16 MEDIATEK INC
  • US20250021827A1 patent drawing
  • US20250021827A1 patent drawing
  • US20250021827A1 patent drawing

AI summary

A method for finding at least one optimal post-training quantization model includes converting and optimizing a floating-point machine learning model into a converted machine learning model, applying a plurality of PTO settings to generate a plurality of PTO models, and evaluating the plurality of PTO models based on at least one predetermined indirect metric to find at least one optimal PTO model.