Document Similarity Analysis Using Binary Term Vectors
Find Innovative SolutionsGenerate Solutions
Solution Overview
Problem
It is challenging to efficiently locate documents in large repositories based on similarity to a reference document, as existing methods lack effective mechanisms for comparing and identifying similar content across a vast number of archived documents.
Innovation Solution
A system and method for document similarity analysis that involves identifying frequently occurring terms in a reference document, generating document content identifiers, and comparing these identifiers to those of archived documents, using a document content identifier encoding engine and a similarity analysis engine to quantify and report similarity, with the aid of a user interface and a document repository.
Engineering Contradictions & Design Principles
Engineering Contradiction Analysis
1Measurement precision
If traditional document comparison methods are used in large repositories, then document similarity can be assessed, but search efficiency deteriorates and time consumption increases
Solution Approach 1:
The patent segments documents into individual terms and represents them as binary vectors, where each dimension corresponds to a term's presence or absence. This segmentation allows for efficient comparison by focusing on term-level features rather than comparing entire documents, significantly reducing computational complexity while maintaining similarity assessment accuracy.
Solution Approach 2:
The patent transforms document content into a different parameter space by converting text into binary term presence/absence vectors. This parameter transformation enables the use of efficient binary comparison operations and sorting algorithms, changing the problem from text-based similarity measurement to vector-based comparison, which dramatically improves search efficiency in large repositories.
2Measurement precision
If comprehensive document content is stored for comparison, then similarity assessment accuracy is maintained, but memory requirements increase
Solution Approach 1:
The patent extracts only the essential features for similarity comparison by representing documents as binary vectors of term presence/absence. Instead of storing and comparing complete document content, the system extracts and stores only the critical term information needed for similarity assessment, significantly reducing memory requirements while maintaining comparison accuracy.
Solution Approach 2:
The patent creates simplified binary copies of document content that capture the essential similarity characteristics. These binary term presence/absence vectors serve as efficient representations that consume minimal storage space yet enable accurate similarity comparison, replacing the need to store and process full document text for comparison purposes.
Data Source
AI summary
A method for document similarity analysis. The method includes generating a reference document content identifier for a reference document, including identifying frequently occurring terms in reference document content, encoding each frequently occurring term in a term identifier and combining the term identifiers to form the reference document content identifier associated with the reference document. The method also includes obtaining at least one document similarity value by comparing the reference document content identifier to a set of archived document content identifiers stored in a document repository.


