Automated Dataset Configuration for Language Model Training

Resolve Bottlenecks,
Find Innovative Solutions
Generate Solutions

Solution Overview

Problem

Existing technologies face challenges in automatically configuring and formatting diverse datasets for fine-tuning language models, due to variations in dataset structure, content, and licensing issues, making manual configuration impractical.

Innovation Solution

A system comprising a dataset configuration component that automatically converts and formats datasets to comply with language model requirements, identifies suitable datasets, applies licensing checks, and merges datasets to create a fused language model.

Engineering Contradictions & Design Principles

VSEngineering Contradiction Analysis

1Manufacturing precision

If manual configuration of datasets is performed, then dataset quality and compliance can be ensured, but time consumption and labor costs increase significantly

Engineering Contradiction:
Improvedataset configuration qualityVSAvoidconfiguration time
Core Design Contradiction:
Manufacturing precisionVSLoss of time

Solution Approach 1:

The system performs preliminary actions by pre-defining dataset schemas, validation rules, and transformation templates before actual dataset configuration. This allows automated validation and formatting to occur during the configuration process itself, ensuring quality without manual intervention while maintaining efficiency.

Inventive Principle:
Principle #10Preliminary action

Solution Approach 2:

The dataset configuration system enables self-service through automated validation, formatting, and compliance checking mechanisms. The system automatically detects and corrects formatting issues, validates against schemas, and ensures license compliance without requiring manual configuration, thereby maintaining high quality while reducing time consumption.

Inventive Principle:
Principle #25Self-service

2Adaptability or versatility

If diverse datasets with different structures are integrated, then model training comprehensiveness improves, but system complexity increases

Engineering Contradiction:
Improvedataset compatibilityVSAvoidconfiguration system complexity
Core Design Contradiction:
Adaptability or versatilityVSDevice complexity

Solution Approach 1:

The system implements universality through a unified dataset schema and standardized transformation pipeline that can handle multiple dataset types and formats. The configuration system uses universal validation rules and formatting templates that apply across different dataset structures, enabling diverse datasets to be integrated without proportionally increasing system complexity.

Inventive Principle:
Principle #6Universality (Multi-functionality)

Solution Approach 2:

The system manages complexity through parameter changes by dynamically adjusting transformation parameters based on the input dataset characteristics. The configuration system automatically detects dataset properties and applies appropriate transformation parameters, allowing flexible adaptation to diverse structures while maintaining a consistent underlying system architecture.

Inventive Principle:
Principle #35Parameter changes

3Reliability

If licensing checks are performed on all datasets, then legal compliance is ensured, but processing time increases

Engineering Contradiction:
Improvelicense complianceVSAvoiddataset processing speed
Core Design Contradiction:
ReliabilityVSProductivity

Solution Approach 1:

The system performs preliminary licensing checks by pre-validating dataset licenses against compliance rules before datasets are added to the training pool. This preliminary action ensures that only compliant datasets proceed through the configuration pipeline, maintaining legal compliance while avoiding repeated validation overhead during processing.

Inventive Principle:
Principle #10Preliminary action

4Productivity

If automated dataset conversion is implemented, then configuration efficiency improves, but accuracy of data formatting may decrease

Engineering Contradiction:
Improveconfiguration efficiencyVSAvoiddata formatting accuracy
Core Design Contradiction:
ProductivityVSManufacturing precision

Solution Approach 1:

The automated conversion system incorporates feedback mechanisms through validation against predefined schemas and transformation rules. The system continuously checks converted datasets for compliance with format requirements and automatically corrects formatting errors, ensuring high accuracy while maintaining automated efficiency. The feedback loop validates each transformation step and reports issues for correction.

Inventive Principle:
Principle #23Feedback

Data Source

PatentUS20250068918A1Automated training on massive multitask
Publication Date: 2025.02.27 INTERNATIONAL BUSINESS MACHINE CORPORATION
  • US20250068918A1 patent drawing
  • US20250068918A1 patent drawing
  • US20250068918A1 patent drawing

AI summary

Various systems and methods are presented herein regarding configuring a series of datasets to be implemented in training a language model (LM). Respective datasets can be automatically configured to comply with one or more configuration requirements of the LM, e.g., with regard to content, formatting, tabular form, correct license, etc. By implementing automated configuration, a plethora of datasets can be automatically configured to enable application of a multitude of datasets on a LM, enable a subsequent fused LM to be generated based fusion of the multitude of datasets.