Transform Vector Generation for Privacy-Preserving Data Mining
Find Innovative SolutionsGenerate Solutions
Solution Overview
Problem
In data mining, especially in sensitive fields like finance and government, protecting privacy is a concern as existing methods fail to effectively anonymize data without affecting the accuracy of mining results.
Innovation Solution
A method and device for generating d-dimensional transform vectors by summing randomly selected original data samples, which are used to train a binary classification model, ensuring the outcome model is consistent with the original data while protecting privacy by making it difficult to restore the original data.
Engineering Contradictions & Design Principles
Engineering Contradiction Analysis
1Measurement precision
If data mining is performed on original data containing sensitive information, then mining accuracy is improved, but privacy protection deteriorates
Solution Approach 1:
The patent creates transformed data samples that copy the statistical properties and mining value of original data while replacing the actual sensitive content. The transformed samples maintain the same distribution characteristics and mining patterns as the original data, allowing accurate mining results while preventing direct access to sensitive information.
Solution Approach 2:
The patent applies parameter transformation by modifying data characteristics through random transformations while preserving essential statistical properties. The transformed data maintains the same mean, variance, and distribution patterns as the original data, ensuring mining accuracy is not compromised while privacy is protected.
2Object-affected harmful factors
If data is anonymized to protect privacy, then privacy protection is improved, but mining result accuracy deteriorates
Solution Approach 1:
The transformed data samples are designed to copy the essential statistical properties and structural characteristics of the original data. By preserving distribution patterns, correlation structures, and statistical moments, the transformed data enables accurate mining results while maintaining privacy protection through the replacement of actual sensitive values.
Solution Approach 2:
The patent employs parameter transformation techniques that modify individual data points while preserving higher-order statistical parameters. The transformed data maintains consistent statistical properties such as mean, variance, skewness, and kurtosis, ensuring that mining algorithms produce accurate results comparable to those from original data.
3Object-affected harmful factors
If transform vectors are generated from multiple original samples, then privacy protection is improved, but data processing complexity increases
Solution Approach 1:
The patent combines multiple original data samples into transformed samples through aggregation operations. By merging the information from multiple samples while introducing random transformations, the system achieves better privacy protection through data aggregation while the computational complexity remains manageable through efficient sampling and transformation algorithms.
Data Source
AI summary
A privacy protection based training sample generation method includes: generating n d-dimensional transform vectors π from original data to be mined, wherein the original data comprises m original samples, each original sample includes a d-dimensional original vector x and an output tag value y, m and d being natural numbers, and each transform vector π is determined by a sum of yx of a plurality of original samples randomly selected from the m original samples; and determining the n transform vectors π as training samples of a binary classification model.


