首页  专利技术  电子电路装置的制造及其应用技术

一种基于模型加速强化学习的多星智能协同分析方法与流程

2026-08-13 15:00:07 196次浏览
一种基于模型加速强化学习的多星智能协同分析方法与流程

本发明涉及多星自主协同探测,特别涉及一种基于模型加速强化学习的多星智能协同分析方法。


背景技术:

1、在现有的卫星任务规划研究中,大多是将成像卫星任务规划问题建模为优化问题,然后采用各种智能优化算法进行求解。当前主流的智能优化算法主要包括蚁群算法、模拟退火算法、粒子群算法和遗传算法等。蚁群算法利用了信息素的正反馈特性,能够较快的时间内搜索到较优解,但是算法易陷入早熟,即某路径的信息素浓度明显高于其他路径时,算法会过快的收敛于该路径。模拟退火算法虽然局部搜索能力强,不易于陷入局部最优解,但是收敛速度慢,执行时间长,算法性能与初始值有关及参数敏感等缺点。粒子群算法虽然有较快逼近最优解的能力。但是,由于所有粒子都向最优解的方向飞去,所有粒子趋于同一化(失去了多样性)使得后期收敛速度明显变慢,同时算法收敛到一定精度时,无法继续优化,所能达到的精度也不高。遗传算法在多星协同规划方面应用最为广泛,虽然全局搜索能力较强,但是其也存在一个明显缺点,主要是遗传算法的初始解通常采用随机方式生成,解的搜索空间较大,搜索速度较慢,且在搜素全局最优解时往往会花费较多的时间,影响计算的效率,容易错过观测时间窗口。从而,目前缺少收敛速度快、精度高以及效率高的多星智能协同分析方法。


技术实现思路

1、本发明的目的在于提供一种基于模型加速强化学习的多星智能协同分析方法,以改善上述技术问题。

2、为了实现上述发明目的,本发明实施例提供了以下技术方案:

3、一种基于模型加速强化学习的多星智能协同分析方法,其包括:

4、s1、获取面向海上目标观测的多星协同任务数据;

5、s2、构建深度学习模型;

6、s3、将所述多星协同任务数据输入至所述深度学习模型,得到对应的初始决策结果;

7、s4、利用强化学习算法对所述初始决策结果进行优化,得到对应的最终决策结果;

8、s5、通过多个卫星实施所述最终决策结果,完成对多个卫星的智能协同分析。

9、进一步地,所述多星协同任务数据包括卫星任务信息和窗口信息;所述窗口信息包括n个时间窗口;每个所述时间窗口包括窗口id、窗口开始时间、窗口结束时间、目标覆盖率及其时间窗口的左上角、左下角、右上角和右下角的经纬度;所述任务信息包括任务类型、任务优先级、点观测/区域观测、天气云量、卫星id、载荷类型、分辨率、任务标识、覆盖多边形区域、空间属性、卫星载荷角度。

10、进一步地,所述深度学习模型包括依次串联的四层lstm神经网络;每个所述lstm神经网络包括一个输入层、多个隐藏层和一个输入层;每个所述lstm神经网络的时间步为一个时间窗口。

11、进一步地,所述深度学习模型的训练过程包括:

12、获取面向海上目标观测的历史多星协同任务信息;

13、构建深度学习模型;将所述历史多星协同任务信息输入至所述深度学习模型,得到对应的训练输出值,即训练初始决策结果;

14、基于所述训练初始决策结果构建交叉熵损失函数;利用 adadelta 优化算法对所述交叉熵损失函数进行求解,得到使得所述交叉熵损失函数最小的最优解;

15、基于所述最优解,对所述深度学习模型的参数进行调整,得到初次训练后的深度学习模型;

16、重复上述训练过程直至满足预设的迭代次数,得到训练后的深度学习模型。

17、进一步地,所述强化学习算法采用基于值函数的强化学习方法;

18、所述基于所述初始决策结果,利用强化学习算法对多星协同任务进行强化学习,得到对应的最终决策结果,包括:

19、步骤1、确定多星协同任务的观测需求;

20、步骤2、将多星协同任务转化为马尔可夫决策过程;将单个卫星作为智能体,并定义所述智能体的环境、状态空间、转换模型和奖励函数,将所述初始决策结果作为初始状态;

21、步骤3、根据所述初始状态、所述转换模型和所述观测需求,确定初始策略;根据所述初始策略和奖励函数,计算所述初始状态对应的状态价值函数;

22、步骤4、选择所述状态价值函数最大的动作作为下一状态的动作,并计算对应的状态-动作价值函数,得到对应的q值;

23、步骤5、通过所述智能体实施所述步骤4中的动作,并更新状态;

24、步骤6、根据更新后的状态,更新所述q值;

25、步骤7、重复步骤3至步骤6,直至获得最优q值,即最优状态-动作值函数;

26、步骤8、基于所述最优状态-动作值函数,确定策略,即得到对应的最终决策结果。

27、进一步地,所述环境包括多个卫星的载荷类型、任务属性、业务约束规则;

28、所述业务约束规则为:电子逢过必扫,光学卫星大幅宽低分辨率优先,云量不高于20%,适用于白天,发现目标后采用高分辨率卫星进行跟踪监测;sar卫星大幅宽低分辨率优先,发现目标后采用高分辨率进行跟踪监测。

29、进一步地,所述初始决策结果和所述最终决策结果均为时间窗口选择结果。

30、定义所述奖励函数;所述奖励函数为奖励和惩罚的总结;当增加所述时间窗口或满足所述业务约束规则时,获得所述奖励;当不满足所述业务约束规则时,获得所述惩罚。

31、本发明将深度学习和强化学习进行组合使用,通过引入深度学习模型对常规强化学习算法进行加速,结合了模型历史经验可以持续进行学习,大大减少强化学习智能体与环境交互次数,从而加速算法决策速度。



技术特征:

1.一种基于模型加速强化学习的多星智能协同分析方法,其特征在于,包括:

2.根据权利要求1所述的基于模型加速强化学习的多星智能协同分析方法,其特征在于,所述多星协同任务数据包括卫星任务信息和窗口信息;所述窗口信息包括n个时间窗口;每个所述时间窗口包括窗口id、窗口开始时间、窗口结束时间、目标覆盖率及其时间窗口的左上角、左下角、右上角和右下角的经纬度;所述任务信息包括任务类型、任务优先级、点观测/区域观测、天气云量、卫星id、载荷类型、分辨率、任务标识、覆盖多边形区域、空间属性、卫星载荷角度。

3.根据权利要求2所述的基于模型加速强化学习的多星智能协同分析方法,其特征在于,所述深度学习模型包括依次串联的四层lstm神经网络;每个所述lstm神经网络包括一个输入层、多个隐藏层和一个输入层;每个所述lstm神经网络的时间步为一个时间窗口。

4.根据权利要求3所述的基于模型加速强化学习的多星智能协同分析方法,其特征在于,所述深度学习模型的训练过程包括:

5.根据权利要求4所述的基于模型加速强化学习的多星智能协同分析方法,其特征在于,所述强化学习算法采用基于值函数的强化学习方法;

6.根据权利要求5所述的基于模型加速强化学习的多星智能协同分析方法,其特征在于,所述环境包括多个卫星的载荷类型、任务属性、业务约束规则;

7.根据权利要求5所述的基于模型加速强化学习的多星智能协同分析方法,其特征在于,所述初始决策结果和所述最终决策结果均为时间窗口选择结果。

8.根据权利要求6所述的基于模型加速强化学习的多星智能协同分析方法,其特征在于,定义所述奖励函数;所述奖励函数为奖励和惩罚的总结;当增加所述时间窗口或满足所述业务约束规则时,获得所述奖励;当不满足所述业务约束规则时,获得所述惩罚。


技术总结
本发明公开了一种基于模型加速强化学习的多星智能协同分析方法,其涉及多星自主协同探测技术领域。本发明利用深度学习模型得到对应的输出值;并将多星协同任务形式化表达为马尔可夫决策过程,将深度学习模型的初始决策结果作为初始状态,并进行强化学习,得到最终决策结果。本发明将深度学习和强化学习进行组合使用,通过引入深度学习模型对常规强化学习算法进行加速,结合了模型历史经验可以持续进行学习,大大减少强化学习智能体与环境交互次数,从而加速算法决策速度。

技术研发人员:王梦丽,侯立旺,段龙海,钱磊,王飞虎
受保护的技术使用者:北京道达天际科技股份有限公司
技术研发日:
技术公布日:2024/12/2
文档序号 : 【 40201398 】

技术研发人员:王梦丽,侯立旺,段龙海,钱磊,王飞虎
技术所有人:北京道达天际科技股份有限公司

备 注:该技术已申请专利,仅供学习研究,如用于商业用途,请联系技术所有人。
声 明此信息收集于网络,如果你是此专利的发明人不想本网站收录此信息请联系我们,我们会在第一时间删除
王梦丽侯立旺段龙海钱磊王飞虎北京道达天际科技股份有限公司
一种故障预测方法、程序产品、装置及介质与流程 一种数值天气预报产品气候态自适应订正方法
相关内容