Semantic Entity Similarity via Relation Vector Segmentation
Find Innovative SolutionsGenerate Solutions
Solution Overview
Problem
Current methods for determining text similarity fail to accurately compare semantic descriptions of entities across different texts, as they do not effectively ignore irrelevant entities, which is crucial for applications like multi-article verification and encyclopedia entry classification.
Innovation Solution
A method and apparatus that acquire target texts containing a main entity, extract related entities, calculate sub-relation vectors, and determine semantic similarity based on similarity distances, allowing for accurate comparison of entity descriptions while ignoring irrelevant information.
Engineering Contradictions & Design Principles
Engineering Contradiction Analysis
1Measurement precision
If current text similarity methods are used, then text similarity can be calculated, but the semantic similarity of entities across different texts cannot be accurately determined due to inability to ignore irrelevant entities
Solution Approach 1:
The patent segments the text similarity calculation into entity-level similarity assessment. Instead of comparing entire texts, it extracts individual entities and their relationships, then calculates similarity based on entity attributes and relations. This segmentation allows irrelevant entities to be excluded from the similarity calculation, improving accuracy for multi-article verification and encyclopedia classification tasks.
Solution Approach 2:
The patent extracts relevant entities and their relationships from the text, separating them from irrelevant information. By using relation extraction models to identify only the entities and relations relevant to the main entity, the method filters out noise and focuses the similarity calculation on meaningful semantic content, thereby improving measurement precision while reducing information loss from irrelevant entities.
2Measurement precision
If entity extraction and relation analysis is performed, then semantic similarity can be accurately determined, but processing complexity increases
Solution Approach 1:
The patent employs a multi-functional processing system that handles entity extraction, relation extraction, similarity calculation, and distance computation through integrated modules. The relation extraction model serves multiple purposes: identifying entities, determining relationships, and extracting features for similarity calculation. This universal approach reduces overall system complexity by consolidating multiple functions into coordinated components rather than separate independent systems.
Data Source
AI summary
A method for processing a sematic description of a text entity is proposed. The method includes: acquiring a plurality of target texts containing a main entity, and extracting related entities describing the main entity from each target text; acquiring a sub-relation vector of a pair of the main entity and each related entity in each target text; calculating a similarity distance of the main entity between different target texts based on the sub-relation vector; and determining a semantic similarity of the main entity descripted in different target texts based on the similarity distance.


