OTN Single-Service Configuration with Reward-Guided Resource Optimization
Find Innovative SolutionsGenerate Solutions
Solution Overview
Problem
Existing OTN single service resource configuration methods lack comprehensive optimization, efficiency, and reliability due to step-by-step resource calculation without a unified algorithm, limiting the optimization of service resources and network performance.
Innovation Solution
Employing reinforcement learning technology to create a comprehensive optimization model for OTN single service resource configuration, utilizing action policies and timely rewards to iteratively optimize resource parameters such as route, wavelength, spectrum, and modulation format, with impairment verification, to achieve optimal resource allocation.
Engineering Contradictions & Design Principles
Engineering Contradiction Analysis
1Ease of manufacture
If step-by-step resource calculation is used for OTN single service configuration, then the configuration process is simple to implement, but the optimization comprehensiveness and network performance are limited
Solution Approach 1:
The patent merges multiple resource configuration parameters (route, wavelength, spectrum, modulation format) into a unified reinforcement learning model. Instead of calculating each parameter separately in step-by-step manner, the model jointly optimizes all parameters simultaneously through a single integrated algorithm, achieving comprehensive optimization while maintaining implementation feasibility.
2Reliability
If reinforcement learning model is used for comprehensive optimization, then the optimization comprehensiveness and network performance are improved, but the computational complexity increases
Solution Approach 1:
The patent transforms the complex multi-parameter optimization problem into a reinforcement learning task by changing the representation of configuration parameters into state-action-reward tuples. The model learns optimal configuration strategies through iterative training with reward feedback, converting a computationally intensive optimization problem into a more manageable learning process that achieves comprehensive optimization.
Solution Approach 2:
The patent implements a feedback mechanism through the reward function that evaluates configuration results and guides subsequent optimization iterations. The reward signal provides continuous feedback on configuration quality, enabling the model to learn from past decisions and progressively improve optimization performance without requiring exhaustive computational search.
3Productivity
If multiple resource parameters are configured in sequence within one episode, then the configuration efficiency is improved, but the coordination and consistency among parameters become more difficult to maintain
Solution Approach 1:
The patent creates a universal reinforcement learning model that handles multiple resource parameters (route, wavelength, spectrum, modulation format) within a single unified framework. The model performs multiple configuration tasks simultaneously through one episode, maintaining parameter coordination through the unified policy learned by the reinforcement learning algorithm, thus achieving both efficiency and consistency.
Data Source
AI summary
The present disclosure provides a service resource configuration method, including: configuring resource parameters for a service to be configured according to an action policy, calculating a timely reward in a current state, performing IV analysis according to the action policy, and ending one episode after the IV analysis is completed; calculating and updating, according to the timely reward in each state, an optimization objective policy parameter in each state; iterating a preset number of episodes to calculate and update the optimization objective policy parameter in each state; determining, according to the optimization objective policy parameter in each state in the preset number of episodes, an optimal optimization objective policy parameter in each state; and updating the action policy according to the optimal optimization objective policy parameter in each state. The present disclosure further provides a single service resource configuration apparatus, a computer device and a computer-readable medium.


