Prime Data Element Referencing for Lossless Global Data Reduction

Resolve Bottlenecks,
Find Innovative Solutions
Generate Solutions

Solution Overview

Problem

Current data compression methods are inefficient in handling large and extremely large datasets, as they can only exploit redundancy within a local window and are not suited for random access, leading to limitations in data ingestion and retrieval rates, and fail to effectively reduce data footprint across global storage systems.

Innovation Solution

The Data Distillation™ process identifies prime data elements and uses a content-associative sieve to factorize input data into prime and derivative elements, generating a losslessly reduced representation by referencing prime data elements and a reconstitution program, allowing for efficient data reduction and retrieval across large datasets.

Engineering Contradictions & Design Principles

VSEngineering Contradiction Analysis

1Quantity of substance

If traditional compression methods are used, then data reduction is achieved within local windows, but global redundancy exploitation is limited and data footprint reduction across large datasets is insufficient

Engineering Contradiction:
Improvedata footprintVSAvoidredundancy exploitation scope
Core Design Contradiction:
Quantity of substanceVSAdaptability or versatility

Solution Approach 1:

The patent segments data into fixed-size chunks and organizes them in a hierarchical tree structure, enabling global redundancy exploitation across the entire dataset while maintaining efficient local processing. Each chunk is treated as an independent unit that can be processed, stored, and retrieved separately, yet contributes to global compression through the sieve structure.

Inventive Principle:
Principle #1Segmentation

Solution Approach 2:

The patent introduces a new dimensional organization by creating a content-associative sieve structure that indexes data chunks based on their content rather than sequential position. This enables global redundancy exploitation by allowing direct access to any chunk based on its content characteristics, transforming the traditional linear data access model into a multi-dimensional content-based access model.

Inventive Principle:
Principle #17Another dimension (Dimensionality change)

2Adaptability or versatility

If data is organized for global access, then redundancy exploitation improves, but random access capability is lost

Engineering Contradiction:
Improveredundancy exploitation scopeVSAvoidrandom access capability
Core Design Contradiction:
Adaptability or versatilityVSEase of operation

Solution Approach 1:

The patent performs preliminary organization of data chunks into a hierarchical tree structure with content-based indexing before retrieval operations. The sieve pre-computes and stores content associations, allowing both global redundancy exploitation and efficient random access without requiring full data decompression. This preliminary structuring enables simultaneous optimization of both access modes.

Inventive Principle:
Principle #10Preliminary action

Solution Approach 2:

The patent introduces a content-associative sieve as an intermediary layer between raw data storage and access operations. This sieve structure maintains content-based indexes and metadata that enable both global redundancy analysis and efficient random access to specific chunks, acting as a mediator that preserves random access capability while enabling global optimization.

Inventive Principle:
Principle #24Intermediary (Mediator)

3Quantity of substance

If compression ratios are increased, then data footprint is reduced, but data ingestion and retrieval rates decrease

Engineering Contradiction:
Improvedata footprintVSAvoiddata ingestion and retrieval rates
Core Design Contradiction:
Quantity of substanceVSProductivity

Solution Approach 1:

The patent divides data into fixed-size chunks that can be independently processed, compressed, and retrieved. This segmentation enables parallel processing during ingestion and selective retrieval of only necessary chunks, maintaining high data rates while achieving global compression through the sieve structure.

Inventive Principle:
Principle #1Segmentation

Solution Approach 2:

The patent applies different compression strategies to different data chunks based on their local characteristics and redundancy patterns. The sieve identifies and applies optimal compression techniques to each chunk independently, allowing high compression ratios for redundant data while maintaining fast processing for unique data, thus balancing footprint reduction with data rates.

Inventive Principle:
Principle #3Local quality

Data Source

PatentUS9286313B1Efficient lossless reduction of data by deriving data from prime data elements resident in a content-associative sieve
Publication Date: 2016.03.15 ASCAVA INC
  • US9286313B1 patent drawing
  • US9286313B1 patent drawing
  • US9286313B1 patent drawing

AI summary

This disclosure relates to lossless data reduction on large and extremely large datasets while providing high rates of data ingestion and data retrieval. Some embodiments can generate a losslessly reduced representation of a data chunk, wherein the losslessly reduced representation includes a reference to one or more prime data elements stored in a prime data store, and optionally a description of a reconstitution program which, when applied to the one or more prime data elements results in the data chunk.