Document Similarity via Entity Relationship Embeddings
Find Innovative SolutionsGenerate Solutions
Solution Overview
Problem
Existing methods for determining electronic document similarity are computationally inefficient and time-consuming, particularly when using distance calculations over entire documents, and often require domain knowledge.
Innovation Solution
The method employs word embedding and knowledge graph embedding to extract entities and relationships from documents, computes entity and relationship distances using Earth Mover's Distance, and combines these distances to generate a similarity score, reducing processing time and resource requirements while eliminating the need for domain knowledge.
Engineering Contradictions & Design Principles
Engineering Contradiction Analysis
1Measurement precision
If distance calculations are performed over entire documents to determine similarity, then similarity determination can be performed, but processing time and computational resources increase significantly
Solution Approach 1:
The patent segments documents into entities and relationships, then computes distances at this finer granularity level rather than over entire documents. This segmentation allows similarity to be determined based on constituent elements (entities and their relationships) rather than requiring processing of the complete document structure, thereby reducing computational time while maintaining accuracy.
Solution Approach 2:
The patent extracts entities and relationships from documents and uses these extracted elements as the basis for similarity computation. By taking out only the essential semantic components (entities and relationships) rather than processing entire documents, the system achieves accurate similarity determination with significantly reduced processing time and computational resource requirements.
2Measurement precision
If traditional similarity methods are used, then domain knowledge may be required, but this increases complexity and reduces accessibility
Solution Approach 1:
The patent employs self-service principles by using automatic entity and relationship extraction combined with knowledge graph embedding to determine document similarity. The system performs this autonomously without requiring manual domain knowledge input or expert intervention, making the technology accessible and applicable across different domains without increasing operational complexity.
Solution Approach 2:
The patent introduces knowledge graph embedding as an intermediary mechanism that bridges document content and similarity determination. This intermediary layer automatically captures semantic relationships and computes distances between entities and relationships, eliminating the need for direct domain knowledge requirements while maintaining accurate similarity measurement across diverse document types.
Data Source
AI summary
Methods and systems for using machine learning to determine electronic document similarity include extracting entities and corresponding relationships from each of two electronic documents of a corpus of electronic documents based on word embedding, computing an entity distance between the extracted entities and a relationship distance between the extracted relationships based on knowledge graph embedding, combining the entity and relationship distances to generate a similarity score between the electronic documents, and implementing the similarity score to perform a task associated with the electronic documents.


