Semantic Entity Similarity via Relation Vector Segmentation

Resolve Bottlenecks,
Find Innovative Solutions
Generate Solutions

Solution Overview

Problem

Current methods for determining text similarity fail to accurately compare semantic descriptions of entities across different texts, as they do not effectively ignore irrelevant entities, which is crucial for applications like multi-article verification and encyclopedia entry classification.

Innovation Solution

A method and apparatus that acquire target texts containing a main entity, extract related entities, calculate sub-relation vectors, and determine semantic similarity based on similarity distances, allowing for accurate comparison of entity descriptions while ignoring irrelevant information.

Engineering Contradictions & Design Principles

VSEngineering Contradiction Analysis

1Measurement precision

If current text similarity methods are used, then text similarity can be calculated, but the semantic similarity of entities across different texts cannot be accurately determined due to inability to ignore irrelevant entities

Engineering Contradiction:
Improvesemantic similarity determination accuracyVSAvoidirrelevant entity information
Core Design Contradiction:
Measurement precisionVSLoss of information

Solution Approach 1:

The patent segments the text similarity calculation into entity-level similarity assessment. Instead of comparing entire texts, it extracts individual entities and their relationships, then calculates similarity based on entity attributes and relations. This segmentation allows irrelevant entities to be excluded from the similarity calculation, improving accuracy for multi-article verification and encyclopedia classification tasks.

Inventive Principle:
Principle #1Segmentation

Solution Approach 2:

The patent extracts relevant entities and their relationships from the text, separating them from irrelevant information. By using relation extraction models to identify only the entities and relations relevant to the main entity, the method filters out noise and focuses the similarity calculation on meaningful semantic content, thereby improving measurement precision while reducing information loss from irrelevant entities.

Inventive Principle:
Principle #2Taking out (Extraction)

2Measurement precision

If entity extraction and relation analysis is performed, then semantic similarity can be accurately determined, but processing complexity increases

Engineering Contradiction:
Improveentity description comparison accuracyVSAvoidprocessing system complexity
Core Design Contradiction:
Measurement precisionVSDevice complexity

Solution Approach 1:

The patent employs a multi-functional processing system that handles entity extraction, relation extraction, similarity calculation, and distance computation through integrated modules. The relation extraction model serves multiple purposes: identifying entities, determining relationships, and extracting features for similarity calculation. This universal approach reduces overall system complexity by consolidating multiple functions into coordinated components rather than separate independent systems.

Inventive Principle:
Principle #6Universality (Multi-functionality)

Data Source

PatentUS11669690B2Method and apparatus for processing sematic description of text entity, and storage medium
Publication Date: 2023.06.06 BEIJING BAIDU NETCOM SCI & TECH CO LTD
  • US11669690B2 patent drawing
  • US11669690B2 patent drawing
  • US11669690B2 patent drawing

AI summary

A method for processing a sematic description of a text entity is proposed. The method includes: acquiring a plurality of target texts containing a main entity, and extracting related entities describing the main entity from each target text; acquiring a sub-relation vector of a pair of the main entity and each related entity in each target text; calculating a similarity distance of the main entity between different target texts based on the sub-relation vector; and determining a semantic similarity of the main entity descripted in different target texts based on the similarity distance.