Document Similarity Index via Tag Index Segmentation

Resolve Bottlenecks,
Find Innovative Solutions
Generate Solutions

Solution Overview

Problem

Current document similarity techniques, such as Latent Semantic Indexing (LSI) and Latent Dirichlet Allocation (LDA), require significant computational resources and replicate efforts, leading to high costs and inefficiencies in characterizing and searching documents, especially when integrating disparate systems for complex document mining tasks.

Innovation Solution

The method involves computing a tag index for documents with keyword-weight pairs, identifying the most significant keywords, and calculating full similarities between documents to derive a document similarity index, with thresholds to control the number of similar documents selected for inclusion, thereby optimizing resource usage and reducing redundant operations.

Engineering Contradictions & Design Principles

VSEngineering Contradiction Analysis

1Measurement precision

If full text search solutions and document similarity techniques (LSI, LDA) are implemented, then document characterization and similarity analysis capabilities are improved, but computational resource requirements and operational costs increase significantly

Engineering Contradiction:
Improvedocument similarity analysis capabilityVSAvoidcomputational resource consumption
Core Design Contradiction:
Measurement precisionVSUse of energy by moving object

Solution Approach 1:

The patent segments the document analysis process into two distinct phases: (1) an offline phase that pre-computes and stores term frequencies and document vectors for all documents in the corpus, and (2) an online phase that rapidly calculates similarity scores using the pre-computed data. This segmentation eliminates redundant computations during similarity queries, significantly reducing operational computational resource consumption while maintaining accurate similarity analysis capabilities.

Inventive Principle:
Principle #1Segmentation

2Adaptability or versatility

If complex document mining techniques are integrated, then document processing capabilities are enhanced, but system complexity and implementation costs increase

Engineering Contradiction:
Improvedocument processing capabilityVSAvoidsystem integration complexity
Core Design Contradiction:
Adaptability or versatilityVSDevice complexity

Solution Approach 1:

The patent creates a universal document representation framework using term frequency vectors that can serve multiple document processing functions simultaneously. The same pre-computed document vectors and similarity calculation mechanism support both full-text search operations and document similarity analysis, eliminating the need for separate specialized systems and reducing overall system integration complexity.

Inventive Principle:
Principle #6Universality (Multi-functionality)

3Reliability

If document parsing and mining operations are replicated across multiple techniques, then comprehensive document analysis is achieved, but resource efficiency decreases due to redundant operations

Engineering Contradiction:
Improvedocument analysis comprehensivenessVSAvoidresource utilization efficiency
Core Design Contradiction:
ReliabilityVSProductivity

Solution Approach 1:

The patent performs preliminary action by pre-computing and storing term frequencies and document vectors during an offline phase before any similarity queries are executed. This preliminary preparation ensures that all necessary data for comprehensive document analysis is already available, eliminating the need to replicate parsing and mining operations during online similarity calculations, thus improving resource utilization efficiency while maintaining analysis comprehensiveness.

Inventive Principle:
Principle #10Preliminary action

Data Source

PatentUS8793242B2Deriving document similarity indices
Publication Date: 2014.07.29 MICROSOFT TECHNOLOGY LICENSING LLC
  • US8793242B2 patent drawing
  • US8793242B2 patent drawing
  • US8793242B2 patent drawing

AI summary

Methods, systems, and computer program products are provided for deriving and updating document similarity indices for a plurality of documents. The number of maintained similarities can be controlled to conserve CPU and storage resources.