一种基于元强化学习的GEO在轨服务任务规划方法

By employing a meta-reinforcement learning-based approach, the autonomy and efficiency issues of GEO on-orbit servicing mission planning were addressed. This enabled efficient and rapid mission planning for multiple servicing spacecraft across multiple orbital targets, thereby enhancing the autonomy and adaptability of on-orbit servicing.

CN117382920BActive Publication Date: 2026-07-17KUNMING UNIV OF SCI & TECH

Patent Information

Authority / Receiving Office
CN · China
Patent Type
Patents(China)
Current Assignee / Owner
KUNMING UNIV OF SCI & TECH
Filing Date
2023-10-08
Publication Date
2026-07-17

AI Technical Summary

Technical Problem

GEO on-orbit servicing mission planning faces a complex and ever-changing environment and a variety of uncertainties. Existing technologies struggle to achieve rapid, safe, and efficient mission scheduling and autonomous planning, especially when multiple servicing spacecraft are simultaneously serving multiple targets in different orbits, lacking adaptive and cost-maximizing solutions.

Method used

A meta-reinforcement learning-based approach is adopted. By inputting initial orbital parameters, the multi-cycle Lambert problem is solved, reinforcement learning parameters for on-orbit service planning tasks are defined, an agent interaction environment is constructed, and initial policies are generated using meta-learning algorithms and deep reinforcement learning algorithms to optimize task planning.

Benefits of technology

It has achieved autonomy and flexibility in planning autonomous missions for multiple on-orbit servicing spacecraft, and can quickly and effectively solve GEO on-orbit servicing missions, thereby improving the autonomy and adaptability of planning and ensuring the speed and efficiency of missions.

✦ Generated by Eureka AI based on patent content.

Smart Images

  • Figure CN117382920B_ABST
    Figure CN117382920B_ABST
Patent Text Reader

Abstract

本发明公开了一种基于元强化学习的GEO在轨服务任务规划方法,包括:输入初始轨道参数;求解多圈兰伯特问题;定义在轨服务规划任务强化学习参数;构建智能体交互环境;生成初始策略;依据初始策略生成新策略。本发明将多个在轨服务航天器视作一个具有学习能力的智能体,以转移速度增量、转移消耗时间作为在轨服务任务的优化目标,通过设计多目标融合的奖励函数和形式化约束条件来建立在轨服务任务规划的智能体交互环境,并进一步结合元学习算法与深度强化学习算法,通过元任务学习过去的成功经验并不断优化策略,根据不同在轨服务任务产生一个具有普适性的初始策略,用于新任务的训练,从而提升规划方法的自主性和灵活性。
Need to check novelty before this filing date? Find Prior Art