Cardinality Prediction Model for Substring Queries
Find Innovative SolutionsGenerate Solutions
Solution Overview
Problem
Current methods for predicting cardinality in substring similarity queries using deep learning are lacking, as they do not effectively apply to substring similarity queries, leading to inaccurate predictions when statistical assumptions are incorrect.
Innovation Solution
A deep learning model is developed to predict cardinality for substring similarity queries by generating and training data using a maximum distance threshold for substring edit distances, with algorithms like SODDY and TEDDY for efficient training data generation, and a sequential model for improved prediction accuracy.
Engineering Contradictions & Design Principles
Engineering Contradiction Analysis
1Measurement precision
If statistical assumption methods are used for cardinality prediction, then the prediction process is simple and fast, but the prediction accuracy deteriorates when statistical assumptions are incorrect
Solution Approach 1:
The patent replaces traditional statistical assumption methods with a deep learning-based neural network model. This substitution allows the system to learn complex patterns from data without relying on simplified statistical assumptions, thereby improving prediction accuracy while maintaining computational efficiency through modern hardware acceleration.
Solution Approach 2:
The patent transforms the prediction approach by changing from fixed statistical parameters to learnable model parameters through training. The neural network adapts its internal parameters based on training data, enabling accurate cardinality prediction across diverse query patterns without requiring manual statistical assumptions to be correct.
2Measurement precision
If deep learning models are used for cardinality prediction, then prediction accuracy improves, but model training time and data generation complexity increase
Solution Approach 1:
The patent performs preliminary actions by pre-generating and storing training data before the actual prediction process. The training data is generated in advance using algorithms that simulate various query patterns and compute corresponding cardinalities, so that when the model needs to make predictions, it can do so quickly without time-consuming data generation or complex training procedures.
Solution Approach 2:
The patent creates a simplified representation of the complex database query processing system through training data copies. Instead of training on actual complex query executions, the system uses synthetic training data that captures essential patterns, allowing the deep learning model to learn cardinality prediction rules efficiently and apply them to new queries without reprocessing the entire complex system.
3Measurement precision
If traditional substring similarity query methods are used, then query execution is straightforward, but cardinality prediction accuracy for substring queries deteriorates
Solution Approach 1:
The patent introduces an intermediary layer in the form of a trained neural network model that sits between the query processing system and the cardinality prediction output. This intermediary learns the complex relationships between substring queries and their result cardinalities during training, then provides accurate predictions for new queries without adding significant complexity to the query processing workflow itself.
Data Source
AI summary
The present disclosure relates to a deep learning model for cardinality prediction and, more specifically, to a method for generating and training a model for predicting a cardinality for a similarity query in consideration of a substring condition based on an edit distance.


