Deviation Analysis Feature Selection via Dissimilarity Scoring
Find Innovative SolutionsGenerate Solutions
Solution Overview
Problem
Performing deviation analysis on large datasets with many discrete features is computationally expensive and requires significant resources, making it inefficient.
Innovation Solution
An automated system that selects candidate discrete features based on dissimilarity scores, applying deviation analysis only to those features likely to exhibit significant deviations from a continuous feature, thereby reducing resource consumption and improving analysis quality.
Engineering Contradictions & Design Principles
Engineering Contradiction Analysis
1Measurement precision
If deviation analysis is performed on all discrete features in a large dataset, then comprehensive deviation analysis quality is improved, but computational resource consumption increases significantly
Solution Approach 1:
The patent segments the set of discrete features into two groups: candidate discrete features (those likely to exhibit significant deviations) and non-candidate discrete features (those unlikely to exhibit significant deviations). This segmentation is achieved by computing dissimilarity scores for each discrete feature and selecting those with scores above a threshold as candidates. Deviation analysis is then performed only on the candidate features, reducing computational resource consumption while maintaining analysis quality for the most relevant features.
Solution Approach 2:
The patent applies partial action by performing deviation analysis on only a subset of discrete features (the candidate features) rather than all discrete features. The dissimilarity score computation serves as a filtering mechanism to identify which features warrant full deviation analysis. This approach consumes fewer computational resources compared to exhaustive analysis of all features, while still capturing the most significant deviation patterns.
2Use of energy by moving object
If deviation analysis is performed on fewer discrete features, then computational resource consumption is reduced, but analysis completeness deteriorates
Solution Approach 1:
The patent performs preliminary action by computing dissimilarity scores for each discrete feature before conducting full deviation analysis. This preliminary computation uses statistical measures (such as variance, standard deviation, or other dissimilarity metrics) to assess how differently each discrete feature behaves with respect to the continuous feature. Based on these preliminary scores, the system identifies candidate features that are most likely to exhibit significant deviations, ensuring that the subsequent deviation analysis focuses on the most informative features while maintaining analysis completeness for relevant patterns.
Solution Approach 2:
The dissimilarity score acts as an intermediary metric that bridges the gap between computational efficiency and analysis completeness. By computing this intermediate measure for each discrete feature, the system can objectively identify which features merit full deviation analysis. The dissimilarity score serves as a filtering criterion that preserves information about potentially significant deviations while eliminating features that are unlikely to contribute meaningful insights, thus balancing resource consumption with analysis completeness.
Data Source
AI summary
Systems and methods include determination, determine, for each of a plurality of discrete features, of statistics for each discrete value of the discrete feature based on values of a continuous feature associated with the discrete value, determination, for each discrete feature, of first summary statistics based on the statistics determined for each discrete value of the discrete feature, determination, for each discrete feature, of a dissimilarity based on the first summary statistics determined for the discrete feature and on the statistics determined for each discrete value of the discrete feature, determination of candidate discrete features of the discrete features based on the determined dissimilarities, the candidate discrete features comprising less than all of the discrete features, determination, for each of the candidate discrete features, of second summary statistics based on values of the continuous feature associated with each discrete value of the candidate discrete feature, determine of a deviation score for each of the candidate discrete features based on the second summary statistics, and presentation of the candidate discrete features based on the determined deviation scores.


