Conditionally Independent Data Generation via GAN Discriminators

Resolve Bottlenecks,
Find Innovative Solutions
Generate Solutions

Solution Overview

Problem

Current machine learning systems face challenges in generating conditionally independent data, particularly when dealing with high-dimensional variables, as existing techniques struggle to produce data that is close in distribution to the original data while ensuring conditional independence and fairness, especially in scenarios where data is scarce and unstructured.

Innovation Solution

A computer-implemented method using a generative adversarial network (GAN) with a generator and discriminators to produce conditionally independent training data, employing a divergence calculator to enforce conditional independence and fairness by computing losses based on comparisons and divergence measures, ensuring the generated data satisfies predetermined conditions for use in training machine learning systems.

Engineering Contradictions & Design Principles

VSEngineering Contradiction Analysis

1Quantity of substance

If existing data generation techniques are used, then data quantity can be increased, but the generated data fails to satisfy conditional independence and fairness criteria

Engineering Contradiction:
Improvedata quantityVSAvoidconditional independence satisfaction
Core Design Contradiction:
Quantity of substanceVSReliability

Solution Approach 1:

The patent implements feedback mechanisms through discriminator networks that evaluate generated data against conditional independence criteria. The discriminators provide feedback signals to the generator, enabling iterative refinement of the generated data distribution until conditional independence and fairness constraints are satisfied while maintaining data quantity.

Inventive Principle:
Principle #23Feedback

Solution Approach 2:

The patent introduces discriminator networks as intermediary components between the data generator and the final output. These discriminators act as mediators that enforce conditional independence constraints by evaluating and guiding the generation process, ensuring that generated data satisfies fairness criteria while maintaining utility.

Inventive Principle:
Principle #24Intermediary (Mediator)

2Reliability

If data is generated to satisfy conditional independence, then fairness criteria are met, but the generated data distribution diverges from the original data distribution

Engineering Contradiction:
Improveconditional independence satisfactionVSAvoiddistribution proximity
Core Design Contradiction:
ReliabilityVSMeasurement precision

Solution Approach 1:

The patent employs parameter changes by adjusting the generator network parameters through adversarial training with discriminators. The generator learns to transform the input distribution into an output distribution that satisfies conditional independence constraints while minimizing divergence from the original distribution through iterative parameter optimization.

Inventive Principle:
Principle #35Parameter changes

Solution Approach 2:

The patent replaces traditional mechanical data sampling or transformation methods with a learned generative model. The generator network, trained through adversarial processes, substitutes conventional data generation mechanics with a flexible, differentiable system that can enforce conditional independence while preserving distributional properties.

Inventive Principle:
Principle #28Mechanics substitution (Replace mechanical system)

3Productivity

If traditional training data is used, then model training can proceed, but fairness and conditional independence cannot be ensured

Engineering Contradiction:
Improvetraining efficiencyVSAvoidfairness criteria satisfaction
Core Design Contradiction:
ProductivityVSReliability

Solution Approach 1:

The patent applies preliminary action by pre-processing training data through the conditional independence-aware generator before the main model training begins. This preliminary transformation ensures that the training data satisfies fairness and conditional independence constraints, allowing subsequent model training to proceed efficiently without requiring additional fairness enforcement mechanisms.

Inventive Principle:
Principle #10Preliminary action

Data Source

PatentUS20230021338A1Conditionally independent data generation for training machine learning systems
Publication Date: 2023.01.26 INTERNATIONAL BUSINESS MACHINE CORPORATION
  • US20230021338A1 patent drawing
  • US20230021338A1 patent drawing
  • US20230021338A1 patent drawing

AI summary

A method for training a machine learning system using conditionally independent training data includes receiving an input dataset (p(x, y, z)). A generative adversarial network, that includes a generator and a first discriminator, uses the input dataset to generate a training data (ps (xf, yf, zf)) by generating the values (xf, yf, zf). The first discriminator determines a first loss (L1) based on (xf, yf, zf) and (x, y, z). A divergence calculator modifies the training data based on a dependence measure (γ). The divergence calculator includes a second discriminator and a third discriminator. Modifying the training data includes receiving a reference value ({tilde over (y)}), and computing, by the second discriminator, a second loss (L2) based on (xf, yf, zf) and (xf, {tilde over (y)}, zf). The third discriminator computes a third loss (L3) based on (yf, zf) and ({tilde over (y)}, zf). Further, a fourth loss (L4) is computed based on L2 and L3. The training data is output from the generator if L1 and L4 satisfy a predetermined condition.