一种面向非规则博弈场景的联邦学习激励机制
技术特征:
1.一种面向非规则博弈场景的联邦学习激励机制,其特征在于,包括以下步骤:
2.根据权利要求1所述的一种面向非规则博弈场景的联邦学习激励机制,其特征在于,所述步骤s11的具体步骤如下:
3.根据权利要求1所述的一种面向非规则博弈场景的联邦学习激励机制,其特征在于,所述步骤s12的具体步骤如下:设联邦学习参与者的策略集为s={s1:搭便车策略,s2:合作策略},其中,搭便车策略代表参与者不执行本地模型训练,对全局模型添加随机扰动后上传给服务器;合作策略代表参与者执行本地模型训练并上传本地梯度更新给服务器。
4.根据权利要求1所述的一种面向非规则博弈场景的联邦学习激励机制,其特征在于,所述步骤s13的具体步骤如下:
5.根据权利要求1所述的一种面向非规则博弈场景的联邦学习激励机制,其特征在于,所述步骤s131包括:
6.根据权利要求4所述的一种面向非规则博弈场景的联邦学习激励机制,其特征在于,所述步骤s132包括:
7.根据权利要求4所述的一种面向非规则博弈场景的联邦学习激励机制,其特征在于,所述步骤s133包括:
8.根据权利要求1所述的一种面向非规则博弈场景的联邦学习激励机制,其特征在于,所述步骤s14中的激励模型如下式所示:
9.根据权利要求1所述的一种面向非规则博弈场景的联邦学习激励机制,其特征在于,所述步骤s2中通过多段非线性控制方法来调整奖励和惩罚策略,具体步骤如下:
10.根据权利要求1所述的一种面向非规则博弈场景的联邦学习激励机制,其特征在于,所述步骤s3中进行联邦学习训练的具体步骤如下:
技术总结
本发明公开了一种面向非规则博弈场景的联邦学习激励机制,涉及计算机技术领域,包括以下步骤:步骤S1、构建激励模型,包括:步骤S11、建立基本假设;步骤S12、建立策略空间;步骤S13、建立效用函数,初步建立激励模型;步骤S14、进行动态激励,得到激励模型;步骤S2、调整奖励和惩罚策略;步骤S3、判断是否达到停止条件,达到则停止,未达到则进行联邦学习训练,再次重复步骤S14和步骤S2,直至达到停止条件。本发明采用上述结构的一种面向非规则博弈场景的联邦学习激励机制,针对联邦学习搭便车问题,提出了基于演化博弈论的激励机制,实现了有效的激励,提高了联邦学习模型性能和社会福利。
技术研发人员:张沁楠,陈天翔,王冯,邱望洁,揭晚晴,何锦淳,苗淑怡,郑志明
受保护的技术使用者:北京航空航天大学
技术研发日:
技术公布日:2024/12/2
文档序号 :
【 40200527 】
技术研发人员:张沁楠,陈天翔,王冯,邱望洁,揭晚晴,何锦淳,苗淑怡,郑志明
技术所有人:北京航空航天大学
备 注:该技术已申请专利,仅供学习研究,如用于商业用途,请联系技术所有人。
声 明 :此信息收集于网络,如果你是此专利的发明人不想本网站收录此信息请联系我们,我们会在第一时间删除
技术研发人员:张沁楠,陈天翔,王冯,邱望洁,揭晚晴,何锦淳,苗淑怡,郑志明
技术所有人:北京航空航天大学
备 注:该技术已申请专利,仅供学习研究,如用于商业用途,请联系技术所有人。
声 明 :此信息收集于网络,如果你是此专利的发明人不想本网站收录此信息请联系我们,我们会在第一时间删除
