Distributed Availability Management for Virtualized Clusters

Resolve Bottlenecks,
Find Innovative Solutions
Generate Solutions

Solution Overview

Problem

High availability systems face challenges in managing redundancy and availability when virtualization is introduced, as the current Availability Management Framework (AMF) architecture is not scalable and can lead to inappropriate remedial actions across multiple hardware platforms.

Innovation Solution

A distributed availability management system is introduced, comprising a global availability management core and local availability management components, with optional plug-in extensions, to provide a hierarchical structure that supports multiple clusters and virtual nodes, ensuring efficient availability management across diverse hardware platforms.

Engineering Contradictions & Design Principles

VSEngineering Contradiction Analysis

1Reliability

If a traditional AMF architecture is used with independent availability management for each cluster, then each cluster can manage its own redundancy independently, but the system becomes non-scalable and may take inappropriate remedial actions when virtualization is introduced across multiple hardware platforms

Engineering Contradiction:
Improveavailability managementVSAvoidscalability
Core Design Contradiction:
ReliabilityVSAdaptability or versatility

Solution Approach 1:

The availability management system is segmented into a hierarchical structure with a global availability management core (AMCg) at the top level and local availability management cores (AMCl) at lower levels. This segmentation allows the system to maintain independent cluster management while introducing coordinated oversight, enabling scalability without sacrificing reliability. Each level performs specific functions: the global core coordinates across clusters and virtualization boundaries, while local cores handle cluster-specific redundancy management.

Inventive Principle:
Principle #1Segmentation

Solution Approach 2:

The global availability management core acts as an intermediary between multiple local AMCs and the underlying hardware platforms. It mediates availability management decisions across virtualized environments, preventing inappropriate remedial actions by coordinating between clusters. The intermediary layer translates and harmonizes availability management operations across different hardware platforms and virtualization boundaries.

Inventive Principle:
Principle #24Intermediary (Mediator)

2Adaptability or versatility

If virtualization is introduced across multiple hardware platforms, then resource utilization and flexibility improve, but the traditional AMF architecture cannot properly coordinate availability management across virtual nodes belonging to different clusters

Engineering Contradiction:
Improvevirtualization supportVSAvoidavailability management coordination
Core Design Contradiction:
Adaptability or versatilityVSDevice complexity

Solution Approach 1:

The system adds a new dimension to availability management by introducing a global coordination layer that operates above the traditional cluster level. This dimensional addition allows the system to manage virtualized resources across multiple clusters without increasing complexity within individual clusters. The global AMCg provides cross-cluster visibility and coordination, enabling virtualization support while maintaining manageable complexity through hierarchical organization.

Inventive Principle:
Principle #17Another dimension (Dimensionality change)

3Device complexity

If a single dedicated node is used for handling failures in an N+1 redundancy model, then the system is simple to manage, but it does not provide sufficient redundancy when a single HA system manages many services

Engineering Contradiction:
Improveredundancy managementVSAvoidredundancy sufficiency
Core Design Contradiction:
Device complexityVSReliability

Solution Approach 1:

The global availability management core provides universal coordination capabilities that enable multiple redundancy models to operate simultaneously across different services and clusters. Instead of being limited to a single N+1 model with one dedicated node, the system can implement N+M redundancy, shared redundancy pools, and service-specific redundancy strategies. The global AMCg coordinates resource sharing and failure handling across multiple services, providing sufficient redundancy without requiring separate dedicated nodes for each service.

Inventive Principle:
Principle #6Universality (Multi-functionality)

Data Source

PatentUS7716517B2Distributed platform management for high availability systems
Publication Date: 2010.05.11 TELEFONAKTIEBOLAGET LM ERICSSON (PUBL)
  • US7716517B2 patent drawing
  • US7716517B2 patent drawing
  • US7716517B2 patent drawing

AI summary

A distributed model for availability management (AM) functions is described. Core AM functionality is provided by at a global level, while supplemental AM functionality is provided at a local (e.g., cluster) level. Extension entities can be provided to supplement provided AM functions.