基于多智能体深度强化学习的电力通信系统鲁棒路由方法
技术特征:
1.基于多智能体深度强化学习的电力通信系统鲁棒路由方法,所述电力通信系统由采集量测数据的信息源节点、接受和转发量测数据包的路由节点以及通信链路构成,其特征在于,包括以下步骤:
2.根据权利要求1所述的基于多智能体深度强化学习的电力通信系统鲁棒路由方法,其特征在于,在步骤s1中,电力通信系统用无向图g=<v,e>表示,其中v代表所有路由节点的集合,e代表所有通信链路的集合;每个路由节点均与固定数量的信息源节点相连,接受信息源节点产生的量测数据包并将其存储到缓冲区中,每个数据包都有一个路由节点作为目标节点,当数据包到达对应目标节点后从系统中移除;通信链路采用全双工通信机制,通信链路两端的数据包能够同时向对侧传输,并且共享传输带宽;电力通信系统的状态方程为:
3.根据权利要求1所述的基于多智能体深度强化学习的电力通信系统鲁棒路由方法,其特征在于,在步骤s2中,将路由优化问题转化为多智能体强化学习问题,其中电力通信系统被视为交互环境,路由节点被视为智能体,智能体的观测空间、动作空间及外部奖励定义如下:
4.根据权利要求1所述的基于多智能体深度强化学习的电力通信系统鲁棒路由方法,其特征在于,在步骤s3中,所述多头注意力神经网络用aω表示,其输入为所有智能体的观测量o=(o1,o2,...,oi,...,on)和路由决策a=(a1,a2,...,ai,...,an),输出为每个智能体i的注意力特征zi,其中oi为第i个智能体的观测量,为第i个智能体的路由决策;每个智能体i的观测-动作向量对首先通过嵌入层神经网络fi(oi,ai)被转化为维度为nh的编码向量ei,每个智能体i第k个注意力头的输出能够表示为其它智能体value向量的加权和,表示为:
5.根据权利要求1所述的基于多智能体深度强化学习的电力通信系统鲁棒路由方法,其特征在于,在步骤s4中,采用soft-actor-critic算法交替训练改进评论家网络和路由策略网络的参数,路由策略网络的参数θ=(θ1,θ2,...,θi,...,θn)的更新目标为使状态价值最大化,其中θi代表智能体i策略网络的参数,所有智能体的联合损失函数l(θ)用以下公式表示:
技术总结
本发明公开了一种基于多智能体深度强化学习的电力通信系统鲁棒路由方法,包括:建立电力通信系统的信息流模型,将路由节点视为智能体,根据路由优化的目标设计智能体的观测空间、动作空间和奖励函数,将路由优化问题转化为多智能体深度强化学习问题,为每个智能体设计路由策略网络和改进评论家网络,采用Soft‑Actor‑Critic算法交替更新每个智能体的路由策略网络和改进评论家网络的参数,得到所有智能体的最优路由策略网络,用于输出最优的路由决策,当电力通信系统遭受网络攻击或发生故障时,不同智能体之间通过最优路由决策的协同,维持正常量测数据包的传输延时在允许范围内。本发明可应用于毫秒级控制的电力通信场景,使电力通信系统的通信延时和丢包率最小。
技术研发人员:夏候凯顺,徐兴业,杜威,刘肇熙,吴青华
受保护的技术使用者:华南理工大学
技术研发日:
技术公布日:2024/12/5
技术研发人员:夏候凯顺,徐兴业,杜威,刘肇熙,吴青华
技术所有人:华南理工大学
备 注:该技术已申请专利,仅供学习研究,如用于商业用途,请联系技术所有人。
声 明 :此信息收集于网络,如果你是此专利的发明人不想本网站收录此信息请联系我们,我们会在第一时间删除
