OTN Single-Service Configuration with Reward-Guided Resource Optimization

Resolve Bottlenecks,
Find Innovative Solutions
Generate Solutions

Solution Overview

Problem

Existing OTN single service resource configuration methods lack comprehensive optimization, efficiency, and reliability due to step-by-step resource calculation without a unified algorithm, limiting the optimization of service resources and network performance.

Innovation Solution

Employing reinforcement learning technology to create a comprehensive optimization model for OTN single service resource configuration, utilizing action policies and timely rewards to iteratively optimize resource parameters such as route, wavelength, spectrum, and modulation format, with impairment verification, to achieve optimal resource allocation.

Engineering Contradictions & Design Principles

VSEngineering Contradiction Analysis

1Ease of manufacture

If step-by-step resource calculation is used for OTN single service configuration, then the configuration process is simple to implement, but the optimization comprehensiveness and network performance are limited

Engineering Contradiction:
Improveconfiguration process simplicityVSAvoidoptimization comprehensiveness
Core Design Contradiction:
Ease of manufactureVSReliability

Solution Approach 1:

The patent merges multiple resource configuration parameters (route, wavelength, spectrum, modulation format) into a unified reinforcement learning model. Instead of calculating each parameter separately in step-by-step manner, the model jointly optimizes all parameters simultaneously through a single integrated algorithm, achieving comprehensive optimization while maintaining implementation feasibility.

Inventive Principle:
Principle #5Merging (Combining)

2Reliability

If reinforcement learning model is used for comprehensive optimization, then the optimization comprehensiveness and network performance are improved, but the computational complexity increases

Engineering Contradiction:
Improveoptimization comprehensivenessVSAvoidcomputational complexity
Core Design Contradiction:
ReliabilityVSDevice complexity

Solution Approach 1:

The patent transforms the complex multi-parameter optimization problem into a reinforcement learning task by changing the representation of configuration parameters into state-action-reward tuples. The model learns optimal configuration strategies through iterative training with reward feedback, converting a computationally intensive optimization problem into a more manageable learning process that achieves comprehensive optimization.

Inventive Principle:
Principle #35Parameter changes

Solution Approach 2:

The patent implements a feedback mechanism through the reward function that evaluates configuration results and guides subsequent optimization iterations. The reward signal provides continuous feedback on configuration quality, enabling the model to learn from past decisions and progressively improve optimization performance without requiring exhaustive computational search.

Inventive Principle:
Principle #23Feedback

3Productivity

If multiple resource parameters are configured in sequence within one episode, then the configuration efficiency is improved, but the coordination and consistency among parameters become more difficult to maintain

Engineering Contradiction:
Improveconfiguration efficiencyVSAvoidparameter coordination consistency
Core Design Contradiction:
ProductivityVSStability of the object's composition

Solution Approach 1:

The patent creates a universal reinforcement learning model that handles multiple resource parameters (route, wavelength, spectrum, modulation format) within a single unified framework. The model performs multiple configuration tasks simultaneously through one episode, maintaining parameter coordination through the unified policy learned by the reinforcement learning algorithm, thus achieving both efficiency and consistency.

Inventive Principle:
Principle #6Universality (Multi-functionality)

Data Source

PatentUS12495229B2Single service resource configuration method and apparatus, computer device and medium
Publication Date: 2025.12.09 ZTE CORP
  • US12495229B2 patent drawing
  • US12495229B2 patent drawing
  • US12495229B2 patent drawing

AI summary

The present disclosure provides a service resource configuration method, including: configuring resource parameters for a service to be configured according to an action policy, calculating a timely reward in a current state, performing IV analysis according to the action policy, and ending one episode after the IV analysis is completed; calculating and updating, according to the timely reward in each state, an optimization objective policy parameter in each state; iterating a preset number of episodes to calculate and update the optimization objective policy parameter in each state; determining, according to the optimization objective policy parameter in each state in the preset number of episodes, an optimal optimization objective policy parameter in each state; and updating the action policy according to the optimal optimization objective policy parameter in each state. The present disclosure further provides a single service resource configuration apparatus, a computer device and a computer-readable medium.