NER Models Using Augmented Capitalization Data
Find Innovative SolutionsGenerate Solutions
Solution Overview
Problem
Existing named entity recognition (NER) models struggle with generalizing to documents with incorrect capitalization, as they are typically trained on datasets with consistent capitalization, leading to poor performance in informal text genres where capitalization is frequently incorrect.
Innovation Solution
The use of augmented training data with both upper-cased and lower-cased versions of the original data, combined with diversified word embedding lookups that perform case-sensitive and case-insensitive searches, helps the model recognize entities regardless of capitalization.
Engineering Contradictions & Design Principles
Engineering Contradiction Analysis
1Manufacturing precision
If NER models are trained on datasets with consistent capitalization, then training data quality is improved, but the model's ability to generalize to informal text with incorrect capitalization deteriorates
Solution Approach 1:
The patent applies parameter changes by transforming the training data through multiple capitalization states (upper-case, lower-case, and mixed case) to create augmented training datasets. This allows the model to learn entity recognition patterns across different capitalization parameters, improving generalization to informal text while maintaining training quality through systematic data transformation rather than random noise addition.
2Device complexity
If traditional NER models are used, then model simplicity is maintained, but performance on informal text genres deteriorates
Solution Approach 1:
The patent implements preliminary action by pre-processing the training data to create multiple capitalization variants (upper-case, lower-case, and mixed case versions) before model training. This preliminary data preparation ensures that the model encounters diverse capitalization patterns during training, improving its reliability on informal text without requiring complex architectural modifications to the base NER model.
Solution Approach 2:
The patent uses composite materials by combining multiple versions of the same training data with different capitalization states into a unified augmented dataset. This composite training corpus integrates upper-case, lower-case, and mixed case variations, creating a richer training material that improves model performance on informal text while maintaining the simplicity of the underlying NER architecture.
3Reliability
If data augmentation with multiple capitalization versions is applied, then model robustness is improved, but training data processing complexity increases
Solution Approach 1:
The patent applies segmentation by dividing the data augmentation process into distinct, manageable stages: generating upper-case versions, generating lower-case versions, and creating mixed case variants. Each segmentation handles a specific capitalization transformation, making the overall data processing complexity more controllable and systematic while achieving robust model training through comprehensive capitalization coverage.
Data Source
AI summary
Techniques for named-entity recognition are described. An exemplary implementation of a method includes extracting character features for each word of the document using a first encoder; extracting word level representations of for each word position using a second encoder, the word level representations being a concatenation of spelling variants; classifying the word level representations according to a first decoder; and outputting the classifications as named-entity labels.


