Machine Learning Probability Estimation for Unknown Data Classification

Resolve Bottlenecks,
Find Innovative Solutions
Generate Solutions

Solution Overview

Problem

Existing data classification systems, such as those used in security systems against cyberattacks, can accurately determine the correctness of classifications but fail to output the probability of data belonging to each class.

Innovation Solution

A learning apparatus that includes a classification estimation part, a classification probability correction vector calculator, and a training part to generate and train a machine learning model, using feature vectors and classification ratio vectors to output classification probabilities for each class.

Engineering Contradictions & Design Principles

VSEngineering Contradiction Analysis

1Measurement precision

If a machine learning model is used for data classification, then classification accuracy is improved, but the ability to output classification probability for each class deteriorates

Engineering Contradiction:
Improveclassification accuracyVSAvoidclassification probability information
Core Design Contradiction:
Measurement precisionVSLoss of information

Solution Approach 1:

The patent segments the classification process into two distinct components: a primary classification model that determines class membership with high accuracy, and a secondary probability estimation model that outputs classification probabilities for each class. This segmentation allows each component to specialize in its respective function, resolving the contradiction between accuracy and probability output capability

Inventive Principle:
Principle #1Segmentation

Solution Approach 2:

The patent introduces an intermediary mechanism (the probability estimation model) that bridges the gap between the classification model and the required probability outputs. This intermediary translates classification results into probability distributions across all classes, preserving probability information without compromising classification accuracy

Inventive Principle:
Principle #24Intermediary (Mediator)

2Productivity

If only classification object data is used for training, then training efficiency is improved, but the model's ability to handle unknown data deteriorates

Engineering Contradiction:
Improvetraining efficiencyVSAvoidunknown data handling capability
Core Design Contradiction:
ProductivityVSAdaptability or versatility

Solution Approach 1:

The patent applies preliminary action by pre-training the probability estimation model using not only classification object data but also other relevant data sources before deployment. This pre-training prepares the model to handle unknown data scenarios, improving adaptability while maintaining training efficiency through structured data preparation

Inventive Principle:
Principle #10Preliminary action

Solution Approach 2:

The patent changes the parameter scope of training data by incorporating diverse data sources and adjusting data distribution parameters. This allows the model to learn from a broader range of patterns and scenarios, enhancing its ability to generalize to unknown data while maintaining efficient training through optimized parameter configurations

Inventive Principle:
Principle #35Parameter changes

Data Source

PatentUS20250245566A1Learning apparatus, learning method, and program
Publication Date: 2025.07.31 NT T INC
  • US20250245566A1 patent drawing
  • US20250245566A1 patent drawing
  • US20250245566A1 patent drawing

AI summary

A learning apparatus for training a machine learning model that outputs information to be used for estimating a classification probability for each class, the learning apparatus including a classification estimation process observation part that generates an estimation process feature vector based on data of an estimation process in classification of data, and a training part that trains the machine learning model by having a feature vector list obtained by adding at least a second estimation process feature vector obtained from data different from classification object data to a first estimation process feature vector obtained from the classification object data as input to the machine learning model, and by using a classification ratio vector list in which at least a second classification ratio vector different from a first classification ratio vector, being a correct answer to the classification object data, has been added to the first classification ratio vector as a correct answer to the input to the machine learning model.