Hadoop and Hive Throughput Sizing for Query Response Time

Resolve Bottlenecks,
Find Innovative Solutions
Generate Solutions

Solution Overview

Problem

Existing sizing models for Hadoop and Hive implementations fail to account for data throughput as a performance limiter, neglecting factors such as query types, data partitioning, bucketing, Bloom filters, file formats, and architecture, leading to inadequate performance metric fulfillment.

Innovation Solution

A method that measures performance metrics, forecasts future values, configures throughput model parameters, computes throughput requirements, and deploys resources based on these requirements to ensure desired performance metrics are met, considering various architectures.

Engineering Contradictions & Design Principles

VSEngineering Contradiction Analysis

1Productivity

If existing sizing models are used for Hadoop and Hive implementations, then storage capacity can be determined, but throughput performance and query response time cannot be adequately optimized

Engineering Contradiction:
Improvequery response timeVSAvoidsizing model complexity
Core Design Contradiction:
ProductivityVSDevice complexity

Solution Approach 1:

The patent transforms traditional storage-based sizing parameters into throughput-based parameters. Instead of sizing solely based on storage capacity, the system uses throughput models that incorporate query types, data partitioning, bucketing, Bloom filters, file formats, and architecture to determine resource requirements. This parameter transformation enables accurate prediction of query response time while maintaining manageable model complexity through structured input categories.

Inventive Principle:
Principle #35Parameter changes

Solution Approach 2:

The system implements feedback mechanisms by measuring actual data performance metrics and using these measurements to forecast future throughput requirements. The throughput model continuously refines its predictions based on actual query patterns and performance data, enabling dynamic adjustment of resource allocation to optimize query response time while adapting to changing workloads.

Inventive Principle:
Principle #23Feedback

2Reliability

If throughput-based sizing is implemented, then performance metrics can be met, but measurement and modeling complexity increases

Engineering Contradiction:
Improveperformance metric fulfillmentVSAvoidthroughput measurement complexity
Core Design Contradiction:
ReliabilityVSDifficulty of detecting and measuring

Solution Approach 1:

The throughput model is segmented into distinct input categories: query types, data partitioning configurations, bucketing parameters, Bloom filter settings, file formats, and architecture types. Each category represents a specific aspect of system configuration that independently influences throughput. This segmentation simplifies measurement by breaking down complex throughput analysis into manageable components, each with defined measurement protocols.

Inventive Principle:
Principle #1Segmentation

Solution Approach 2:

The system performs preliminary measurements of data performance metrics during system deployment and operation. These preliminary data are used to forecast future throughput requirements before actual resource allocation is made. By conducting measurements and building models in advance, the system eliminates the need for complex real-time measurement during query execution, reducing operational complexity.

Inventive Principle:
Principle #10Preliminary action

3Measurement precision

If comprehensive throughput factors are considered in sizing, then accurate performance prediction is achieved, but system configuration complexity increases

Engineering Contradiction:
Improvethroughput requirement accuracyVSAvoidsystem configuration complexity
Core Design Contradiction:
Measurement precisionVSDevice complexity

Solution Approach 1:

The throughput model is designed as a universal framework that can accommodate multiple factors influencing system performance through a single integrated structure. The model handles diverse input types (query patterns, data organization, compression settings, architecture choices) through unified processing logic, enabling accurate throughput prediction without requiring separate configuration mechanisms for each factor. This multi-functionality reduces configuration complexity while maintaining measurement precision.

Inventive Principle:
Principle #6Universality (Multi-functionality)

Data Source

PatentUS12423596B2Throughput based sizing for hive deployment
Publication Date: 2025.09.23 KYNDRYL INC
  • US12423596B2 patent drawing
  • US12423596B2 patent drawing
  • US12423596B2 patent drawing

AI summary

A data performance measurement of a computer system is measured. A future value of the data performance measurement is forecasted by executing a forecasting model. A set of throughput model input parameters is configured. A throughput requirement for the computer system is computed by executing a throughput model using the set of throughput model input parameters and the future value of the data performance measurement. A capacity requirement corresponding to the throughput requirement is determined. A resource within the computer system is deployed according to the capacity requirement.