一种面向非规则博弈场景的联邦学习激励机制

本发明涉及计算机,尤其是涉及一种面向非规则博弈场景的联邦学习激励机制。
背景技术:
1、随着大数据时代的到来,互联网和计算机技术快速发展,人工智能技术再一次迎来了飞跃。但传统的机器学习方法通常需要收集大量的数据,并集中在服务器中训练人工智能模型。在现实场景中,单个参与者往往没有足够的数据来支持模型的训练,而且很多原始数据涉及到用户的隐私,如果将多个参与者的数据集中起来进行训练,就会存在隐私泄露的风险,由此引发了“数据孤岛”问题。
2、为解决“数据孤岛”问题带来的挑战,2016年google提出了一种新的机器学习范式,称为联邦学习(federated learning,fl)。联邦学习不需要使用集中存储的数据来训练模型,而是在保证数据隐私的同时,使用分布在多个参与者的数据来学习一个高质量的集中式模型。它要求参与者使用自己的数据在本地训练模型,并将不含原始数据的本地模型上传到服务器进行多方模型聚合,得到一个涵盖多方特征的全局模型。
3、在联邦学习中,所有参与者维护的全局模型是一种公共物品,其特点是非排他性(即,无法排除个体使用它们)和非竞争性(即,使用它们不存在竞争)。由于参与者的自私性,他们可能会不遵守既定的协议流程,以获得更高的利益。具体来说,对于联邦学习,最终的全局模型是非排他性的,因为即使一个参与者没有贡献任何本地数据训练模型,其他参与者也不能排除该参与者使用全局模型。同时,最终的全局模型也是非竞争性的,因为所有参与者都可以单独使用全局模型,不存在竞争。
4、因此,自私的参与者可能会选择不进行本地训练以降低计算成本,此类行为被称为搭便车。然而,搭便车行为的存在不利于全局模型的训练。首先,当搭便车的参与者较多时,模型的训练次数和数据量会减少,从而导致全局模型精度下降。其次,搭便车行为对那些使用本地数据进行训练的参与者是不公平的,会不利于参与者的长期合作。因此,设计激励机制来减少联邦学习中的搭便车参与者的数量,促进参与者的有效合作是非常有必要的。
5、随着联邦学习在工业界的广泛应用,人们对联邦学习激励机制也展开了深入的研究。然而,现有的联邦学习激励机制都建立在传统的博弈模型之下,他们具有强烈的假设,例如,假设参与者是绝对理性且信息完全的,他们遵循使用占优策略和最大期望效用的原则。然而,在实际的非规则博弈场景中,各个参与者的理性是有限的,信息是不完全的,他们可能会通过试错的方式达到博弈的均衡。不同于传统博弈中只考虑在单次训练中用户收益达到静态均衡,其强调的是一种在多轮训练中用户收益的动态均衡。
技术实现思路
1、本发明的目的是提供一种面向非规则博弈场景的联邦学习激励机制,解决上述背景技术中提出的问题,考虑了公共品特性和参与者的有限理性、信息不完全特点构建了联邦学习的演化博弈模型,引入了带有环境反馈的复制动力学框架,设计了一种基于演化博弈的激励模型。
2、为实现上述目的,本发明提供了一种面向非规则博弈场景的联邦学习激励机制,包括以下步骤:
3、步骤s1、构建激励模型,包括:
4、步骤s11、建立基本假设;
5、步骤s12、建立策略空间;
6、步骤s13、建立效用函数,初步建立激励模型;
7、步骤s14、进行动态激励,得到激励模型;
8、步骤s2、调整奖励和惩罚策略;
9、步骤s3、判断是否达到停止条件,达到则停止,未达到则进行联邦学习训练,再次重复步骤s14和步骤s2,直至达到停止条件。
10、优选的,所述步骤s11的具体步骤如下:
11、博弈的参与者为联邦学习场景中的n名参与者,表示为p={p1,p2,...,pn},每个参与者都有自己的本地数据集,由一个中央服务器协调n名参与者来训练全局模型,令ω表示全局模型的权重,参与者找到全局模型的最佳权重ω*,以最小化数据集上的预期损失l(ω),如下式所示:
12、
13、其中,l(ω;pn)是给定ω的参与者pn的本地损失,l(ω)为所有参与者要维护的公共品,l(ω)越小参与者的收益越高。
14、优选的,所述步骤s12的具体步骤如下:设联邦学习参与者的策略集为s={s1:搭便车策略,s2:合作策略+,其中,搭便车策略代表参与者不执行本地模型训练,对全局模型添加随机扰动后上传给服务器;合作策略代表参与者执行本地模型训练并上传本地梯度更新给服务器。
15、优选的,所述步骤s13的具体步骤如下:
16、步骤s131、将参与者的收益建立为训练全局模型准确性函数;
17、步骤s132、计算计算成本、通信成本和向中央服务器的支付成本;
18、步骤s133、计算效用。
19、优选的,所述步骤s131包括:
20、在每轮本地训练中,每个参与者执行k次迭代模型训练,中央服务器共执行r次模型聚合,x=(x1,xi,...,xr)表示执行合作策略的参与者在所有轮次的比例,1-x是执行搭便车策略参与者的比例;
21、第t轮全局模型的准确性定义为训练模型在t轮训练后的损失和最小预期损失l(ωt)-l(ω*)之间的差值;
22、令∈(t)表示经过t轮训练的全局模型的精度,在强凸损失函数l(ω)下,∈(t)模型建模如下式所示:
23、
24、其中,θ0和θ1为正系数,根据损失函数、神经网络结构和数据集分布得出;
25、在∈(t)中,随着t的增加,精度不断提升,精度的边际提升减小,参与者在第t轮中的收益是对全局模型在经过t轮训练和经过t-1轮训练后的精度之差的评估,如下式所示:
26、φ(t)=u(∈(t-1)-∈(t))
27、其中,u表示使用经过训练的全局模型产生的单位收入,通过所有参与者的投票得到。
28、优选的,所述步骤s132包括:
29、(1)计算成本如下式所示:
30、cp=γki
31、其中,υ系数取决于参与者的计算芯片架构系数、参与者在一个本地数据样本上训练模型所需的cpu周期数、参与者的cpu处理速度以及参与者的数据量大小,i取决于参与者的策略集,采取搭便车策略时i=0,采取合作策略时i=1,k表示联邦学习的本地迭代次数;
32、(4)通信成本:在联邦学习中,参与者的通信成本保持不变,表示为m;
33、(5)支付成本:支付成本在所有参与者中都是平等分配的,每个参与者支付的成本表示为p,将其与通信成本m相结合,支付成本如下式所示:
34、cm=m+p。
35、优选的,所述步骤s133包括:
36、参与者n∈n的效用定义为其收益和成本之间的差异,如下式所示:
37、
38、其中,pc是采取合作策略的参与者的效用,pd是采取搭便车策略的参与者的效用。
39、优选的,所述步骤s14中的激励模型如下式所示:
40、
41、其中,表示合作策略随时间的变化率,λ表示种群的学习速率,表示惩罚因子随时间的变化率,α表示检测算法准确率,rc和rd表示非对称惩罚因子,σ表示惩罚因子范围下界,β表示惩罚因子范围下界,ρ表示合作策略和背叛策略总收益期望的分布比率,x表示采取合作策略的比例。
42、优选的,所述步骤s2中通过多段非线性控制方法来调整奖励和惩罚策略,具体步骤如下:
43、基于非线性选择梯度驱动的非对称反馈协同演化多人博弈的广义框架,反馈控制定律f(x,rd)的一般形式如下式所示:
44、f(x,rd)=(ψ1(x,rd)-a1)·(ψ2(x,rd)-a2)·(ψ3(x,rd)-a3)…(an-ψn(x,rd))
45、其中,ψi(x,rd)=bipc-cipd,bi>0,ci>0,ψi(x,rd)表示最简单的线性选择梯度形式,a1...an表示选择梯度形式的常数项。
46、当n=2时,场景简化为f为二次函数,进化模型描述如下:
47、
48、在联邦学习中,通过基于训练轮次和参与者状态选择不同的反馈控制函数,调整反馈的强度来控制各平衡点的稳定性,如下式所示:
49、
50、在固定参数的情况下,目标是将x0∈[0.1,0.9]控制到(xn-τ,xn+τ)的范围内,其中,τ是一个范围值;
51、使用三段状态相关控制函数,f1设置为关闭x=1稳定性的函数,f2设置为打开x=1稳定性的函数,f3是控制种群状态稳定变化的函数,具体过程包括评估初始状态x0,如下所示:
52、当x0>xn+τ时,使用控制律f1来调整x=1的稳定性,将其转换为不稳定的平衡点;
53、当x0<xn-τ时,切换控制律到f2,确保有足够的强度将x=1快速的变为稳定的平衡点,使当前状态向x=1演变;
54、当xn-τ<x0<xn+τ时,切换到控制律f3,以控制状态在目标范围内保持稳定。
55、优选的,所述步骤s3中进行联邦学习训练的具体步骤如下:
56、步骤s31、服务器初始化模型权重,并将全局模型发送给参与者;
57、步骤s32、参与者接收全局模型,并使用本地数据进行模型训练;
58、步骤s33、参与者将训练完成后的本地模型发送给服务器;
59、步骤s34、服务器接收参与者的本地模型,进行模型更新聚合,并根据聚合后的模型更新全局模型;
60、步骤s35、重复执行步骤s31-步骤s34,直到模型精度达到预期的标准或聚合轮次达到设定的次数。
61、因此,本发明采用上述结构的一种面向非规则博弈场景的联邦学习激励机制,具有以下有益效果:
62、现有的联邦学习激励机制都基于理性人、完全信息等强烈假设,而现实场景中参与者之间的博弈往往是非规则的,即参与者是理性有限的、信息不完全的,因此无法实现有效的激励。本发明使用了演化博弈理论来描述非规则博弈场景下参与者的有限理性和信息不完全,首次尝试使用带非对称环境反馈的复制者动力学框架来构建非规则博弈场景下的联邦学习激励模型。针对联邦学习中参与者数据冗余的问题,为提社会福利,本发明设计了多段非线性控制方法,来控制联邦学习参与者策略比例达到期望的范围,实现了非规则博弈场景下联邦学习的有效激励。本发明考虑了非规则博弈场景下参与者的有限理性和信息不完全,针对联邦学习搭便车问题,提出了基于演化博弈论的激励机制,实现了有效的激励,提高了联邦学习模型性能和社会福利。
63、下面通过附图和实施例,对本发明的技术方案做进一步的详细描述。
技术研发人员:张沁楠,陈天翔,王冯,邱望洁,揭晚晴,何锦淳,苗淑怡,郑志明
技术所有人:北京航空航天大学
备 注:该技术已申请专利,仅供学习研究,如用于商业用途,请联系技术所有人。
声 明 :此信息收集于网络,如果你是此专利的发明人不想本网站收录此信息请联系我们,我们会在第一时间删除
