一种基于纵向联邦学习的参与方对齐样本生成系统
技术特征:
1.一种基于纵向联邦学习的参与方对齐样本生成系统,其特征在于:包括:
2.根据权利要求1所述的基于纵向联邦学习的参与方对齐样本生成系统,其特征在于:对于所述参与方包括拥有大量样本数据的a方和少量样本数据的b方,以及a方和b方均信任的协调方c方的情况下,所述多方属性相关性矩阵构建模块构建多方属性相关性矩阵的步骤如下:
3.根据权利要求2所述的基于纵向联邦学习的参与方对齐样本生成系统,其特征在于:步骤s11所述数据预处理包括冗余数据处理、缺失值处理、异常值处理以及数据标准化处理;
4.根据权利要求2所述的基于纵向联邦学习的参与方对齐样本生成系统,其特征在于:在步骤s13中,a方第m个属性和b方第n个属性相关性系数的具体计算流程如下:
5.根据权利要求1所述的基于纵向联邦学习的参与方对齐样本生成系统,其特征在于:所述属性对对应关系建立模块根据多方属性相关性矩阵m,找出其中最大的相关性系数假设该相关性系数分别由a方第m个属性和b方第n个属性计算得到,则认为a方属性和b方属性具有强相关性,可组成一组强相关性属性对同时将重新设为0;根据该属性对循环遍历和中所有取值和其中i=1,...,db,建立属性中各取值与属性的取值之间的对应关系r,具体包括以下步骤:
6.根据权利要求5所述的基于纵向联邦学习的参与方对齐样本生成系统,其特征在于:步骤s22中,设属性总共包含s个属性取值,其中第k个取值为mk,k=1,2,...,s,属性总共包含t个属性取值,其中第q个取值为nq,q=1,2,...,t;建立与属性取值之间的对应关系表r的具体流程如下:
7.根据权利要求1所述的基于纵向联邦学习的参与方对齐样本生成系统,其特征在于:所述缺失值生成模块根据对应关系r,建立和两个属性列中各取值的关联规则;循环遍历a方未对齐数据集中第m个属性中的每个样本值其中i=db+1,...,da,利用关联规则,为a方未对齐数据集中第m个属性中的每个样本值生成对应的b方缺失数据集中第n个属性中的样本值具体包括以下步骤:
8.根据权利要求7所述的基于纵向联邦学习的参与方对齐样本生成系统,其特征在于:步骤s31建立和两个属性列中各取值的关联规则具体流程如下:
9.根据权利要求1所述的基于纵向联邦学习的参与方对齐样本生成系统,其特征在于:循环执行所述属性对对应关系建立模块和缺失值生成模块h轮,每轮循环找出当前相关性最强一组属性对建立该组属性对各属性取值之间的对应关系,利用每轮的对应关系建立当前属性对之间的关联规则;根据属性列之间的关联规则,对b方缺失数据集中与a方属性具有相关性大于γ的属性列进行生成,其中γ为人为给定的阈值;循环迭代轮数h等于a、b两方相关性大于γ的属性列对数;
10.根据权利要求9所述的基于纵向联邦学习的参与方对齐样本生成系统,其特征在于:所述步骤s46具体包括以下步骤:
技术总结
本发明涉及一种基于纵向联邦学习的参与方对齐样本生成系统,属于数据生成填补技术领域,包括:多方属性相关性矩阵构建模块:用于将多个参与方的样本数据集进行对齐,并计算各参与方之间每个属性的相关性,构建多方属性相关性矩阵;属性对对应关系建立模块:用于根据多方属性相关性矩阵,分别从对齐样本数据集的各方中找出具有强相关性的属性对,建立该属性对中两个属性列所有取值间的对应关系;缺失值生成模块:用于根据对应关系,建立两个属性列取值的关联规则,对参与方属性列的缺失值进行生成;生成对抗填补模块:利用参与方数据样本和生成的属性列缺失值对参与方剩余属性列的缺失值进行生成填补,获得完整的多方联合对齐样本数据集。
技术研发人员:刘歆,何杭轩,钱鹰,万邦睿,陈奉
受保护的技术使用者:重庆邮电大学
技术研发日:
技术公布日:2024/12/2
技术研发人员:刘歆,何杭轩,钱鹰,万邦睿,陈奉
技术所有人:重庆邮电大学
备 注:该技术已申请专利,仅供学习研究,如用于商业用途,请联系技术所有人。
声 明 :此信息收集于网络,如果你是此专利的发明人不想本网站收录此信息请联系我们,我们会在第一时间删除
