Cardinality Prediction Model for Substring Queries

Resolve Bottlenecks,
Find Innovative Solutions
Generate Solutions

Solution Overview

Problem

Current methods for predicting cardinality in substring similarity queries using deep learning are lacking, as they do not effectively apply to substring similarity queries, leading to inaccurate predictions when statistical assumptions are incorrect.

Innovation Solution

A deep learning model is developed to predict cardinality for substring similarity queries by generating and training data using a maximum distance threshold for substring edit distances, with algorithms like SODDY and TEDDY for efficient training data generation, and a sequential model for improved prediction accuracy.

Engineering Contradictions & Design Principles

VSEngineering Contradiction Analysis

1Measurement precision

If statistical assumption methods are used for cardinality prediction, then the prediction process is simple and fast, but the prediction accuracy deteriorates when statistical assumptions are incorrect

Engineering Contradiction:
Improvecardinality prediction accuracyVSAvoidprediction model complexity
Core Design Contradiction:
Measurement precisionVSDevice complexity

Solution Approach 1:

The patent replaces traditional statistical assumption methods with a deep learning-based neural network model. This substitution allows the system to learn complex patterns from data without relying on simplified statistical assumptions, thereby improving prediction accuracy while maintaining computational efficiency through modern hardware acceleration.

Inventive Principle:
Principle #28Mechanics substitution (Replace mechanical system)

Solution Approach 2:

The patent transforms the prediction approach by changing from fixed statistical parameters to learnable model parameters through training. The neural network adapts its internal parameters based on training data, enabling accurate cardinality prediction across diverse query patterns without requiring manual statistical assumptions to be correct.

Inventive Principle:
Principle #35Parameter changes

2Measurement precision

If deep learning models are used for cardinality prediction, then prediction accuracy improves, but model training time and data generation complexity increase

Engineering Contradiction:
Improvecardinality prediction accuracyVSAvoidmodel generation time
Core Design Contradiction:
Measurement precisionVSLoss of time

Solution Approach 1:

The patent performs preliminary actions by pre-generating and storing training data before the actual prediction process. The training data is generated in advance using algorithms that simulate various query patterns and compute corresponding cardinalities, so that when the model needs to make predictions, it can do so quickly without time-consuming data generation or complex training procedures.

Inventive Principle:
Principle #10Preliminary action

Solution Approach 2:

The patent creates a simplified representation of the complex database query processing system through training data copies. Instead of training on actual complex query executions, the system uses synthetic training data that captures essential patterns, allowing the deep learning model to learn cardinality prediction rules efficiently and apply them to new queries without reprocessing the entire complex system.

Inventive Principle:
Principle #26Copying

3Measurement precision

If traditional substring similarity query methods are used, then query execution is straightforward, but cardinality prediction accuracy for substring queries deteriorates

Engineering Contradiction:
Improvecardinality prediction accuracy for substring queriesVSAvoidquery processing simplicity
Core Design Contradiction:
Measurement precisionVSEase of operation

Solution Approach 1:

The patent introduces an intermediary layer in the form of a trained neural network model that sits between the query processing system and the cardinality prediction output. This intermediary learns the complex relationships between substring queries and their result cardinalities during training, then provides accurate predictions for new queries without adding significant complexity to the query processing workflow itself.

Inventive Principle:
Principle #24Intermediary (Mediator)

Data Source

PatentUS20240256610A1Device and Method for Generating Cardinality Prediction Model for Approximate Substring Query
Publication Date: 2024.08.01 SEOUL NATIONAL UNIVERSITY R&DB FOUNDATION
  • US20240256610A1 patent drawing
  • US20240256610A1 patent drawing
  • US20240256610A1 patent drawing

AI summary

The present disclosure relates to a deep learning model for cardinality prediction and, more specifically, to a method for generating and training a model for predicting a cardinality for a similarity query in consideration of a substring condition based on an edit distance.