Data Quality Rule Generation for Centralized Duplicate Datasets

Resolve Bottlenecks,
Find Innovative Solutions
Generate Solutions

Solution Overview

Problem

Large organizations face challenges with duplicate datasets leading to increased infrastructure costs and skewed data analysis, necessitating improved database management systems to enhance data quality and reduce storage expenses.

Innovation Solution

A computing system that analyzes datasets for data quality characteristics, identifies patterns, and generates data quality rule recommendations, allowing users to implement rules based on input, applies these rules to new data, and determines whether to include or discard data based on confidence scores.

Engineering Contradictions & Design Principles

VSEngineering Contradiction Analysis

1Adaptability or versatility

If duplicate datasets are stored to various databases and servers, then data availability and access flexibility improve, but infrastructure costs increase and data accuracy deteriorates

Engineering Contradiction:
Improvedata access flexibilityVSAvoidinfrastructure costs
Core Design Contradiction:
Adaptability or versatilityVSLoss of energy

Solution Approach 1:

The patent merges duplicate datasets into a single centralized dataset, eliminating redundant storage across multiple databases and servers. This consolidation maintains data accessibility while reducing infrastructure requirements and costs.

Inventive Principle:
Principle #5Merging (Combining)

Solution Approach 2:

The centralized dataset serves as a universal data source for multiple teams and projects, replacing the need for separate duplicate datasets. This single dataset provides universal access while eliminating the infrastructure overhead of multiple storage locations.

Inventive Principle:
Principle #6Universality (Multi-functionality)

2Adaptability or versatility

If duplicate datasets are stored to various databases and servers, then data availability improves, but data analysis accuracy deteriorates

Engineering Contradiction:
Improvedata availabilityVSAvoiddata analysis accuracy
Core Design Contradiction:
Adaptability or versatilityVSMeasurement precision

Solution Approach 1:

By merging duplicate datasets into a single centralized dataset, the patent eliminates data inconsistency across multiple sources. This ensures that all teams analyze the same unified data, improving measurement precision and analysis accuracy while maintaining broad data availability.

Inventive Principle:
Principle #5Merging (Combining)

3Reliability

If manual data quality rule creation is performed, then data quality control improves, but time consumption and operational complexity increase

Engineering Contradiction:
Improvedata quality controlVSAvoidtime consumption
Core Design Contradiction:
ReliabilityVSLoss of time

Solution Approach 1:

The system performs self-service by automatically analyzing datasets and generating data quality rules without manual intervention. The automated analysis identifies data quality issues and creates appropriate rules, eliminating the time-consuming manual rule creation process while maintaining reliable data quality control.

Inventive Principle:
Principle #25Self-service

Solution Approach 2:

The system performs preliminary analysis of datasets to proactively identify potential quality issues before they affect data usage. By pre-generating data quality rules based on this analysis, the system prevents future data quality problems without requiring time-consuming manual rule creation.

Inventive Principle:
Principle #10Preliminary action

4Productivity

If automated data quality rule generation is implemented, then productivity improves, but system complexity increases

Engineering Contradiction:
Improvedata quality rule generation efficiencyVSAvoidsystem complexity
Core Design Contradiction:
ProductivityVSDevice complexity

Solution Approach 1:

The patent replaces the mechanical process of manual data quality rule creation with an automated computational system. This substitution uses algorithms and data analysis techniques to generate rules automatically, significantly improving productivity while the modular system architecture keeps complexity manageable.

Inventive Principle:
Principle #28Mechanics substitution (Replace mechanical system)

Data Source

PatentUS12608351B2Database and data structure management systems
Publication Date: 2026.04.21 TRUIST BANK
  • US12608351B2 patent drawing
  • US12608351B2 patent drawing
  • US12608351B2 patent drawing

AI summary

Systems and methods access, from one or more data storage locations, a dataset; perform data analysis on the dataset to detect one or more data quality characteristics each corresponding to at least one data quality dimension including timeliness, uniqueness, accuracy, completeness, validity, or consistency; evaluate the one or more data quality characteristics present in the dataset to identify one or more common patterns; and generate one or more data quality rule recommendations based on the identified one or more common patterns.