基于全匿样本数据的模型训练方法、装置及存储介质与流程

    技术2026-07-07  14


    本发明涉及计算机,尤其涉及一种基于全匿样本数据的模型训练方法、装置及存储介质。


    背景技术:

    1、现有的联邦学习技术,可以让多个数据源在原始数据不互相流转的前提下,仅通过交互不敏感的中间变量,共同完成模型训练,从而可以利用训练后的模型便利地为用户提供各种分析预测服务。但是,相关技术中的联邦学习,是基于各参与方的交集样本数据是不敏感、可以互相暴露的前提下而实现的。然而在很多实际场景中,各参与方的交集数据对于某些参与方来说也是属于敏感的信息,因此会导致这些参与方的敏感信息泄露给了其他参与方。

    2、为了解决这个问题,相关技术中提出了可以通过在交集样本数据中加入随机的非真实的样本数据的方式以降低交集样本数据发生泄露的可能性。但是这种方法会使得用于模型训练的样本数据远远多于真实的交集样本数据,不仅会影响模型的训练效率,而且非真实的样本数据还会影响模型训练的准确性,从而会影响训练后的模型对数据信息的预测准确性。


    技术实现思路

    1、以下是对本文详细描述的主题的概述。本概述并非是为了限制权利要求的保护范围。

    2、本发明实施例提供了一种基于全匿样本数据的模型训练方法、装置及存储介质,能够在对各参与方的交集样本数据实现全匿的情况下,降低用于模型训练的交集样本数据的数据量,从而可以提高模型的训练效率以及训练准确性,进而可以提高模型的预测准确性。

    3、一方面,本发明实施例提供了一种基于全匿样本数据的模型训练方法,包括以下步骤:

    4、根据求交数据类型对待进行样本数据求交的本地样本数据进行数据过滤得到候选本地样本,其中,所述候选本地样本包括样本标识信息和样本特征信息;

    5、对所述候选本地样本中的所述样本标识信息和所述样本特征信息进行数据随机拆分,得到至少两个与所述候选本地样本同等维度的候选样本数据矩阵分片,将至少两个所述候选样本数据矩阵分片中的任意一个作为本地样本数据矩阵分片,与进行样本数据求交的对侧参与方进行矩阵交互以及矩阵拼接,得到本地碎片拼接矩阵;

    6、接收所述对侧参与方发送的同态加密后的对侧密文拼接矩阵,根据所述对侧密文拼接矩阵对所述本地碎片拼接矩阵进行特征随机乱序及标识加密处理,得到本地密文矩阵和本地输出矩阵,将所述本地密文矩阵发送给所述对侧参与方,使得所述对侧参与方对所述本地密文矩阵进行同态解密得到对侧明文矩阵;

    7、对所述本地输出矩阵进行同态加密得到本地密文输出矩阵,将所述本地密文输出矩阵发送给所述对侧参与方,接收所述对侧参与方发送的根据所述本地密文输出矩阵对所述对侧明文矩阵进行所述特征随机乱序及标识加密处理后得到的对侧密文矩阵;

    8、对所述对侧密文矩阵进行同态解密得到本地明文矩阵,对所述本地明文矩阵进行基于重复标识的矩阵重建得到全匿样本数据交集矩阵,利用所述全匿样本数据交集矩阵对数据预测模型进行训练。

    9、另一方面,本发明实施例还提供了一种基于全匿样本数据的模型训练装置,包括:

    10、样本过滤单元,用于根据求交数据类型对待进行样本数据求交的本地样本数据进行数据过滤得到候选本地样本,其中,所述候选本地样本包括样本标识信息和样本特征信息;

    11、第一交互单元,用于对所述候选本地样本中的所述样本标识信息和所述样本特征信息进行数据随机拆分,得到至少两个与所述候选本地样本同等维度的候选样本数据矩阵分片,将至少两个所述候选样本数据矩阵分片中的任意一个作为本地样本数据矩阵分片,与进行样本数据求交的对侧参与方进行矩阵交互以及矩阵拼接,得到本地碎片拼接矩阵;

    12、第二交互单元,用于接收所述对侧参与方发送的同态加密后的对侧密文拼接矩阵,根据所述对侧密文拼接矩阵对所述本地碎片拼接矩阵进行特征随机乱序及标识加密处理,得到本地密文矩阵和本地输出矩阵,将所述本地密文矩阵发送给所述对侧参与方,使得所述对侧参与方对所述本地密文矩阵进行同态解密得到对侧明文矩阵;

    13、第三交互单元,用于对所述本地输出矩阵进行同态加密得到本地密文输出矩阵,将所述本地密文输出矩阵发送给所述对侧参与方,接收所述对侧参与方发送的根据所述本地密文输出矩阵对所述对侧明文矩阵进行所述特征随机乱序及标识加密处理后得到的对侧密文矩阵;

    14、模型训练单元,用于对所述对侧密文矩阵进行同态解密得到本地明文矩阵,对所述本地明文矩阵进行基于重复标识的矩阵重建得到全匿样本数据交集矩阵,利用所述全匿样本数据交集矩阵对数据预测模型进行训练。

    15、可选地,所述本地碎片拼接矩阵和所述对侧密文拼接矩阵均包括有标识列和特征列;所述第二交互单元还用于:

    16、将所述本地碎片拼接矩阵与所述对侧密文拼接矩阵进行信息相加,得到完整密文矩阵;

    17、对所述完整密文矩阵进行特征随机乱序,得到乱序密文矩阵;

    18、对所述乱序密文矩阵进行标识加密,得到标识加密密文矩阵;

    19、根据所述标识加密密文矩阵的标识列生成与所述标识加密密文矩阵同等维度的目标随机数矩阵,将所述标识加密密文矩阵与所述目标随机数矩阵进行基于特征列的相减得到本地密文矩阵,并将所述目标随机数矩阵作为本地输出矩阵。

    20、可选地,所述第二交互单元还用于执行以下至少之一:

    21、对所述完整密文矩阵中的各行进行随机位置调整,得到乱序密文矩阵;

    22、或者,对所述完整密文矩阵中的各个特征列进行随机位置调整,得到乱序密文矩阵。

    23、可选地,所述第二交互单元还用于:

    24、生成预设长度的随机数;

    25、将所述乱序密文矩阵的标识列中的各项标识信息加上所述随机数,得到标识加密密文矩阵。

    26、可选地,所述第二交互单元还用于:

    27、获取所述标识加密密文矩阵的标识列;

    28、获取所述标识加密密文矩阵的行数和所述标识加密密文矩阵的特征列的列数;

    29、根据所述标识加密密文矩阵的行数和所述标识加密密文矩阵的特征列的列数生成候选随机数矩阵;

    30、将所述标识加密密文矩阵的标识列与所述候选随机数矩阵进行拼接,得到与所述标识加密密文矩阵同等维度的目标随机数矩阵。

    31、可选地,所述模型训练单元还用于:

    32、确定所述本地明文矩阵中内容重复的目标标识信息;

    33、根据所述目标标识信息对所述本地明文矩阵进行矩阵重建,得到全匿样本数据交集矩阵。

    34、可选地,所述模型训练单元还用于:

    35、在所述本地明文矩阵中,删除所述目标标识信息所在行之外的其他所有行,得到候选交集矩阵;

    36、对所述候选交集矩阵进行基于重复标识的特征合并,得到全匿样本数据交集矩阵。

    37、可选地,所述模型训练单元还用于:

    38、确定所述候选交集矩阵中内容重复的候选标识信息;

    39、将内容重复的所述候选标识信息所对应的特征信息进行对应相加,得到全匿样本数据交集矩阵。

    40、可选地,所述第一交互单元还用于:

    41、将至少两个所述候选样本数据矩阵分片中的任意一个作为本地样本数据矩阵分片发送给进行样本数据求交的对侧参与方,并接收所述对侧参与方发送的对侧样本数据矩阵分片;

    42、将所述本地样本数据矩阵分片和所述对侧样本数据矩阵分片进行矩阵拼接,得到本地碎片拼接矩阵。

    43、可选地,所述本地样本数据矩阵分片和所述对侧样本数据矩阵分片均包括有特征列;所述第一交互单元还用于:

    44、生成第一随机碎片矩阵和第二随机碎片矩阵,其中,所述第一随机碎片矩阵的行数与所述本地样本数据矩阵分片的行数相同,所述第一随机碎片矩阵的列数与所述对侧样本数据矩阵分片的特征列数相同,所述第二随机碎片矩阵的行数与所述对侧样本数据矩阵分片的行数相同,所述第二随机碎片矩阵的列数与所述本地样本数据矩阵分片的特征列数相同;

    45、将所述本地样本数据矩阵分片、所述对侧样本数据矩阵分片、所述第一随机碎片矩阵和所述第二随机碎片矩阵进行矩阵拼接,得到本地碎片拼接矩阵。

    46、可选地,所述全匿样本数据交集矩阵包括标签列和特征列;所述模型训练单元还用于:

    47、将所述全匿样本数据交集矩阵中特征列的内容作为训练样本,输入至数据预测模型进行数据预测,得到预测结果;

    48、将所述全匿样本数据交集矩阵中标签列的内容作为训练标签,与所述预测结果计算得到预测损失值;

    49、根据所述预测损失值对所述数据预测模型的参数进行修正。

    50、另一方面,本发明实施例还提供了一种基于全匿样本数据的模型训练装置,包括:

    51、至少一个处理器;

    52、至少一个存储器,用于存储至少一个程序;

    53、当至少一个所述程序被至少一个所述处理器执行时实现如前面所述的基于全匿样本数据的模型训练方法。

    54、另一方面,本发明实施例还提供了一种计算机可读存储介质,其中存储有处理器可执行的计算机程序,所述处理器可执行的计算机程序被处理器执行时用于实现如前面所述的基于全匿样本数据的模型训练方法。

    55、另一方面,本发明实施例还提供了一种计算机程序产品,包括计算机程序或计算机指令,所述计算机程序或所述计算机指令存储在计算机可读存储介质中,基于全匿样本数据的模型训练装置的处理器从所述计算机可读存储介质读取所述计算机程序或所述计算机指令,所述处理器执行所述计算机程序或所述计算机指令,使得所述模型训练装置执行如前面所述的基于全匿样本数据的模型训练方法。

    56、本发明实施例至少包括以下有益效果:本侧参与方先根据求交数据类型对待进行样本数据求交的本地样本数据进行数据过滤得到候选本地样本,可以降低用于进行样本数据求交的样本数据量,从而可以提高进行样本数据求交的效率。然后,本侧参与方对候选本地样本中的样本标识信息和样本特征信息进行数据随机拆分得到至少两个与候选本地样本同等维度的候选样本数据矩阵分片,并将至少两个候选样本数据矩阵分片中的任意一个作为本地样本数据矩阵分片,与进行样本数据求交的对侧参与方进行矩阵交互以及矩阵拼接,得到本地碎片拼接矩阵,可以使得用于进行样本数据求交的本地碎片拼接矩阵是各参与方的拆分数据,从而可以降低各参与方的样本数据发生泄露的可能性。接着,本侧参与方接收对侧参与方发送的同态加密后的对侧密文拼接矩阵,根据对侧密文拼接矩阵对本地碎片拼接矩阵进行特征随机乱序及标识加密处理,得到本地密文矩阵和本地输出矩阵,并将本地密文矩阵发送给对侧参与方,使得对侧参与方对本地密文矩阵进行同态解密得到对侧明文矩阵,由于对侧密文拼接矩阵是对侧参与方通过同态加密后得到的,因此对侧密文拼接矩阵可用于进行样本数据求交,并且在样本数据求交的过程中本侧参与方无法得到对侧参与方的明文数据,因此可以提高对侧参与方的数据保密性;此外,由于本地密文矩阵是根据对侧密文拼接矩阵对本地碎片拼接矩阵进行特征随机乱序及标识加密处理后得到的,因此本地密文矩阵是特征内容乱序且标识内容加密的数据矩阵,即使对侧参与方对本地密文矩阵进行复原,也无法准确得到本侧参与方的本地碎片拼接矩阵的原始内容,从而可以提高本侧参与方的数据保密性及安全性。在将本地密文矩阵发送给对侧参与方后,本侧参与方将对本地输出矩阵进行同态加密后得到的本地密文输出矩阵发送给对侧参与方,接收对侧参与方发送的根据本地密文输出矩阵对对侧明文矩阵进行特征随机乱序及标识加密处理后得到的对侧密文矩阵,然后对对侧密文矩阵进行同态解密得到本地明文矩阵,接着对本地明文矩阵进行基于重复标识的矩阵重建得到全匿样本数据交集矩阵,并利用全匿样本数据交集矩阵对数据预测模型进行训练。由于发送给对侧参与方进行特征随机乱序及标识加密处理的本地密文输出矩阵是同态加密后的矩阵,因此本地密文输出矩阵可用于进行样本数据求交,并且在样本数据求交的过程中对侧参与方无法得到本侧参与方的明文数据,因此可以提高本侧参与方的数据保密性;此外,由于对侧密文矩阵是根据本地密文输出矩阵对对侧明文矩阵进行特征随机乱序及标识加密处理后得到的,因此对侧密文矩阵是特征内容乱序且标识内容加密的数据矩阵,即使本侧参与方对对侧密文矩阵进行复原,也无法准确得到对侧参与方的对侧明文矩阵的内容,从而可以提高对侧参与方的数据保密性及安全性。也就是说,本发明实施例能够实现对本侧参与方及对侧参与方的样本数据的全匿,因此可以有效提高双方的数据安全性。另外,由于进行基于重复标识的矩阵重建的本地明文矩阵是明文样本数据,因此可以避免采用密文样本数据进行矩阵重建而导致的性能损耗,降低处理耗时,从而可以提高对数据预测模型的整体训练效率;此外,由于用于对数据预测模型进行训练的全匿样本数据交集矩阵是进行基于重复标识的矩阵重建而得到的交集样本数据,即全匿样本数据交集矩阵的数据量会小于本地明文矩阵的数据量,因此可以降低用于模型训练的交集样本数据的数据量,从而可以提高模型的训练效率以及训练准确性,进而可以提高模型的预测准确性。

    57、本发明的其它特征和优点将在随后的说明书中阐述,并且,部分地从说明书中变得显而易见,或者通过实施本发明而了解。本发明的目的和其他优点可通过在说明书以及附图中所特别指出的结构来实现和获得。


    技术特征:

    1.一种基于全匿样本数据的模型训练方法,其特征在于,包括以下步骤:

    2.根据权利要求1所述的方法,其特征在于,所述本地碎片拼接矩阵和所述对侧密文拼接矩阵均包括有标识列和特征列;

    3.根据权利要求2所述的方法,其特征在于,所述对所述完整密文矩阵进行特征随机乱序,得到乱序密文矩阵,包括以下至少之一:

    4.根据权利要求2所述的方法,其特征在于,所述对所述乱序密文矩阵进行标识加密,得到标识加密密文矩阵,包括:

    5.根据权利要求2所述的方法,其特征在于,所述根据所述标识加密密文矩阵的标识列生成与所述标识加密密文矩阵同等维度的目标随机数矩阵,包括:

    6.根据权利要求1所述的方法,其特征在于,所述对所述本地明文矩阵进行基于重复标识的矩阵重建得到全匿样本数据交集矩阵,包括:

    7.根据权利要求6所述的方法,其特征在于,所述根据所述目标标识信息对所述本地明文矩阵进行矩阵重建,得到全匿样本数据交集矩阵,包括:

    8.根据权利要求7所述的方法,其特征在于,所述对所述候选交集矩阵进行基于重复标识的特征合并,得到全匿样本数据交集矩阵,包括:

    9.根据权利要求1所述的方法,其特征在于,所述将至少两个所述候选样本数据矩阵分片中的任意一个作为本地样本数据矩阵分片,与进行样本数据求交的对侧参与方进行矩阵交互以及矩阵拼接,得到本地碎片拼接矩阵,包括:

    10.根据权利要求9所述的方法,其特征在于,所述本地样本数据矩阵分片和所述对侧样本数据矩阵分片均包括有特征列;

    11.根据权利要求1所述的方法,其特征在于,所述全匿样本数据交集矩阵包括标签列和特征列;所述利用所述全匿样本数据交集矩阵对数据预测模型进行训练,包括:

    12.一种基于全匿样本数据的模型训练装置,其特征在于,包括:

    13.一种基于全匿样本数据的模型训练装置,其特征在于,包括:

    14.一种计算机可读存储介质,其特征在于,其中存储有处理器可执行的计算机程序,所述处理器可执行的计算机程序被处理器执行时用于实现如权利要求1至11任意一项所述的基于全匿样本数据的模型训练方法。

    15.一种计算机程序产品,包括计算机程序或计算机指令,其特征在于,所述计算机程序或所述计算机指令存储在计算机可读存储介质中,基于全匿样本数据的模型训练装置的处理器从所述计算机可读存储介质读取所述计算机程序或所述计算机指令,所述处理器执行所述计算机程序或所述计算机指令,使得所述模型训练装置执行如权利要求1至11任意一项所述的基于全匿样本数据的模型训练方法。


    技术总结
    本发明公开了一种基于全匿样本数据的模型训练方法、装置及存储介质,先对本地样本数据进行数据过滤得到候选本地样本,再对候选本地样本进行随机拆分得到本地样本数据矩阵分片,并将本地样本数据矩阵分片与对侧参与方进行交互得到本地碎片拼接矩阵,然后基于本地碎片拼接矩阵与对侧参与方依次进行相同的特征随机乱序及标识加密处理得到对侧密文矩阵,并对同态解密后的本地明文矩阵进行基于重复标识的矩阵重建得到全匿样本数据交集矩阵,接着利用全匿样本数据交集矩阵训练数据预测模型。本发明实施例可降低模型训练所需的样本数据量以提高训练效率和准确性,还可提高模型训练后的预测准确性。本发明实施例可应用于联邦学习领域的各种应用场景中。

    技术研发人员:谭明超
    受保护的技术使用者:腾讯科技(深圳)有限公司
    技术研发日:
    技术公布日:2024/10/24
    转载请注明原文地址:https://symbian.8miu.com/read-44835.html

    最新回复(0)