NER Models Using Augmented Capitalization Data

Resolve Bottlenecks,
Find Innovative Solutions
Generate Solutions

Solution Overview

Problem

Existing named entity recognition (NER) models struggle with generalizing to documents with incorrect capitalization, as they are typically trained on datasets with consistent capitalization, leading to poor performance in informal text genres where capitalization is frequently incorrect.

Innovation Solution

The use of augmented training data with both upper-cased and lower-cased versions of the original data, combined with diversified word embedding lookups that perform case-sensitive and case-insensitive searches, helps the model recognize entities regardless of capitalization.

Engineering Contradictions & Design Principles

VSEngineering Contradiction Analysis

1Manufacturing precision

If NER models are trained on datasets with consistent capitalization, then training data quality is improved, but the model's ability to generalize to informal text with incorrect capitalization deteriorates

Engineering Contradiction:
Improvetraining data qualityVSAvoidgeneralization ability
Core Design Contradiction:
Manufacturing precisionVSAdaptability or versatility

Solution Approach 1:

The patent applies parameter changes by transforming the training data through multiple capitalization states (upper-case, lower-case, and mixed case) to create augmented training datasets. This allows the model to learn entity recognition patterns across different capitalization parameters, improving generalization to informal text while maintaining training quality through systematic data transformation rather than random noise addition.

Inventive Principle:
Principle #35Parameter changes

2Device complexity

If traditional NER models are used, then model simplicity is maintained, but performance on informal text genres deteriorates

Engineering Contradiction:
Improvemodel simplicityVSAvoidperformance on informal text
Core Design Contradiction:
Device complexityVSReliability

Solution Approach 1:

The patent implements preliminary action by pre-processing the training data to create multiple capitalization variants (upper-case, lower-case, and mixed case versions) before model training. This preliminary data preparation ensures that the model encounters diverse capitalization patterns during training, improving its reliability on informal text without requiring complex architectural modifications to the base NER model.

Inventive Principle:
Principle #10Preliminary action

Solution Approach 2:

The patent uses composite materials by combining multiple versions of the same training data with different capitalization states into a unified augmented dataset. This composite training corpus integrates upper-case, lower-case, and mixed case variations, creating a richer training material that improves model performance on informal text while maintaining the simplicity of the underlying NER architecture.

Inventive Principle:
Principle #40Composite materials

3Reliability

If data augmentation with multiple capitalization versions is applied, then model robustness is improved, but training data processing complexity increases

Engineering Contradiction:
Improvemodel robustnessVSAvoiddata processing complexity
Core Design Contradiction:
ReliabilityVSDevice complexity

Solution Approach 1:

The patent applies segmentation by dividing the data augmentation process into distinct, manageable stages: generating upper-case versions, generating lower-case versions, and creating mixed case variants. Each segmentation handles a specific capitalization transformation, making the overall data processing complexity more controllable and systematic while achieving robust model training through comprehensive capitalization coverage.

Inventive Principle:
Principle #1Segmentation

Data Source

PatentUS11295083B1Neural models for named-entity recognition
Publication Date: 2022.04.05 AMAZON TECH INC
  • US11295083B1 patent drawing
  • US11295083B1 patent drawing
  • US11295083B1 patent drawing

AI summary

Techniques for named-entity recognition are described. An exemplary implementation of a method includes extracting character features for each word of the document using a first encoder; extracting word level representations of for each word position using a second encoder, the word level representations being a concatenation of spelling variants; classifying the word level representations according to a first decoder; and outputting the classifications as named-entity labels.