Data Pipeline Consistency Checking with Automatically Generated Rules

Resolve Bottlenecks,
Find Innovative Solutions
Generate Solutions

Solution Overview

Problem

Traditional data pipeline monitoring systems face challenges in efficiently generating and updating data rulesets due to the manual effort required, limited high-quality datasets, and the difficulty in adapting to changes in data generation or pipeline operations, leading to issues like schema creep, completeness, accuracy, and debugging complexities.

Innovation Solution

A data pipeline monitoring system that uses data processing circuitry to automatically generate a data standard based on a training dataset, determining similarities and scoring output data sets, and reporting alerts when deviations occur, thereby implicitly defining rules for data integrity.

Engineering Contradictions & Design Principles

VSEngineering Contradiction Analysis

1Reliability

If manual data ruleset definition is used, then data integrity can be monitored, but the process is time-consuming and difficult to maintain

Engineering Contradiction:
Improvedata integrity monitoringVSAvoidruleset generation time
Core Design Contradiction:
ReliabilityVSLoss of time

Solution Approach 1:

The system automatically generates data rulesets by analyzing training datasets without requiring manual intervention. The machine learning model processes data samples, identifies patterns, and creates monitoring rules autonomously, eliminating the time-consuming manual definition process while maintaining data integrity monitoring capabilities

Inventive Principle:
Principle #25Self-service

Solution Approach 2:

The system transforms raw data into structured monitoring rules by changing parameters through automated analysis. The machine learning model extracts key characteristics from training data and converts them into actionable monitoring parameters, enabling efficient ruleset generation without manual effort

Inventive Principle:
Principle #35Parameter changes

2Reliability

If manual data ruleset definition is used, then data quality can be ensured, but updating rulesets is difficult when data changes

Engineering Contradiction:
Improvedata quality monitoringVSAvoidruleset update adaptability
Core Design Contradiction:
ReliabilityVSAdaptability or versatility

Solution Approach 1:

The system dynamically adapts monitoring rules to changing data patterns through continuous machine learning. When new data samples are introduced, the model reanalyzes patterns and automatically updates rulesets, enabling the system to adapt to data changes without manual intervention and maintaining effective data quality monitoring

Inventive Principle:
Principle #15Dynamics

Solution Approach 2:

The system uses feedback from actual data patterns to continuously refine monitoring rules. By analyzing training data and comparing it against current data samples, the machine learning model identifies deviations and automatically adjusts rulesets, creating a feedback loop that maintains adaptability to data changes while ensuring monitoring accuracy

Inventive Principle:
Principle #23Feedback

3Reliability

If traditional monitoring systems are used, then data pipeline operations can be monitored, but schema changes cause malfunctions

Engineering Contradiction:
Improvepipeline operation monitoringVSAvoidschema change tolerance
Core Design Contradiction:
ReliabilityVSAdaptability or versatility

Solution Approach 1:

The system performs preliminary analysis of data patterns through machine learning before actual monitoring occurs. By training on diverse data samples and identifying patterns in advance, the system builds robust monitoring rules that can accommodate schema changes and data variations, preventing malfunctions when data formats evolve

Inventive Principle:
Principle #10Preliminary action

4Reliability

If comprehensive data monitoring is implemented, then data quality improves, but system complexity increases

Engineering Contradiction:
Improvedata qualityVSAvoidmonitoring system complexity
Core Design Contradiction:
ReliabilityVSDevice complexity

Solution Approach 1:

The system replaces complex manual monitoring mechanisms with automated machine learning algorithms. Instead of requiring complex rule definitions and manual updates, the machine learning model automatically processes data, identifies patterns, and generates monitoring rules, simplifying the overall system while maintaining comprehensive data quality monitoring

Inventive Principle:
Principle #28Mechanics substitution (Replace mechanical system)

Data Source

PatentUS20250217447A1System and method for automatic data consistency checking using automatically defined rules
Publication Date: 2025.07.03 DATA CULPA INC
  • US20250217447A1 patent drawing
  • US20250217447A1 patent drawing
  • US20250217447A1 patent drawing

AI summary

A data pipeline monitoring system configured to monitor operations of a data pipeline. In the data pipeline monitoring system, data processing circuitry receives a training data set, processes the training data set, and responsively generates a data standard that indicates a preferred data format. The data pipeline receives an input data set, processes the input data set, responsively generates the output data set, and transfers the output data set to the data processing circuitry. The data processing circuitry receives an output data set from the data pipeline. The data processing circuitry determines similarities between the output data set and the data standard. The data processing circuitry scores the output data set based on the similarity between the output data set and the data standard and reports the score.