本申请属于计算机,具体涉及一种模型训练方法、设备及计算机程序产品。
背景技术:
1、在自监督训练的推动下,大模型逐渐浮现。大模型通常指的是基于transformer架构,且拥有大量的参数和层的模型。大模型通常需要大量的数据和计算资源进行训练,大模型在多个任务上均可以展现出卓越的性能,在众多领域设立了新的性能标准。
2、目前大模型的训练多采用非结构化数据(如图像和/或文本),还没有基于结构化数据进行训练的方案。
技术实现思路
1、本申请提出一种模型训练方法、设备及计算机程序产品,能够实现基于结构化数据对大模型进行训练。
2、本申请第一方面实施例提出了一种模型训练方法,包括:
3、获取训练样本,所述训练样本包括预设时间范围内的多条结构化数据,每条所述结构化数据包括多个特征属性;
4、序列化所述训练样本,获得所述训练样本的输入特征序列;所述输入特征序列包括分类标记数据和位置编码数据,所述位置编码数据用于表征所述训练样本中不同结构化数据生成的先后顺序,所述分类标记数据用于对所述训练样本分类;
5、基于深度学习模型中的编码器对所述输入特征序列进行编码,并从编码后的输入特征序列获取目标分类标记数据;
6、利用所述目标分类标记数据,计算模型损失;
7、基于所述模型损失优化所述深度学习模型的参数,直至所述深度学习模型收敛,获得最终的深度学习模型。
8、在一些实施例中,序列化所述训练样本,获得所述训练样本的输入特征序列,包括:
9、基于所述深度学习模型中的多层感知机,将所述训练样本映射到预设维度的高维空间,获得高维特征序列;
10、向所述高维特征序列添加分类标记数据和位置编码数据,获得所述输入特征序列。
11、在一些实施例中,基于所述深度学习模型中的多层感知机,将所述训练样本映射到预设维度的高维空间,获得高维特征序列,包括:
12、从时间步长和特征属性的类型的维度,双重序列化所述训练样本,生成所述训练样本的特征序列,所述特征序列的长度为所述多个特征属性的数量与所述预设时间范围对应的时间步长的乘积;
13、采用所述多层感知机,将所述特征序列映射到所述预设维度的高维空间,获得所述高维特征序列。
14、在一些实施例中,采用所述多层感知机,将所述特征序列映射到所述预设维度的高维空间,获得所述高维特征序列,包括:
15、对于所述特征序列中的每个子序列,获取与所述每个子序列对应的目标多层感知机;所述每个子序列唯一对应一个特征属性;
16、采用所述目标多层感知机将所述每个子序列映射到所述预设维度的高维空间,获得所述高维特征序列。
17、在一些实施例中,向所述高维特征序列添加分类标记数据和位置编码数据,获得所述输入特征序列,包括:
18、向所述高维特征序列添加随机初始化的所述分类标记数据,获得标记高维特征序列;
19、按照所述特征属性的类型和各所述结构化数据的时间顺序,随机初始化获得维度与所述标记高维特征序列相同的位置编码矩阵;
20、向所述标记高维特征序列中添加所述位置编码矩阵,获得所述输入特征序列。
21、在一些实施例中,利用所述目标分类标记数据,计算模型损失,包括:
22、向所述编码器输入两次所述目标分类标记数据,获得第一编码向量和第二编码向量;以及,向所述编码器输入对比目标分类标记数据,获得第三编码向量;所述第一编码向量和所述第二编码向量不同,所述对比目标分类标记数据对应的对比训练样本与所述训练样本不为同一个训练样本;
23、基于所述第一编码向量、所述第二编码向量和所述第三编码向量,并采用预设的对比学习损失函数,计算所述模型损失。
24、在一些实施例中,序列化所述训练样本,获得所述训练样本的输入特征序列,包括:
25、将所述训练样本包括的所有特征属性转换为数值型特征,获得标准训练样本;
26、序列化所述标准训练样本,获得所述输入特征序列。
27、本申请第二方面实施例提出了一种模型训练装置,包括:
28、获取模块,用于获取训练样本,所述训练样本包括预设时间范围内的多条结构化数据,每条所述结构化数据包括多个特征;
29、获得模块,用于序列化所述训练样本,获得所述训练样本的输入特征序列;所述输入特征序列包括分类标记数据和位置编码数据,所述位置编码数据用于表征所述训练样本中不同结构化数据生成的先后顺序,所述分类标记数据用于对所述训练样本分类;
30、编码模块,用于基于深度学习模型中的编码器对所述输入特征序列进行编码,并从编码后的输入特征序列获取目标分类标记数据;
31、计算模块,用于利用所述目标分类标记数据,计算模型损失;
32、优化模块,用于基于所述模型损失优化所述深度学习模型的参数,直至所述深度学习模型收敛,获得最终的深度学习模型。
33、本申请第三方面实施例提出了一种电子设备,包括存储器、处理器及存储在所述存储器上并可在所述处理器上运行的计算机程序,所述处理器运行所述计算机程序以实现如第一方面所述的方法。
34、本申请第四方面实施例提出了一种计算机程序产品,包括计算机可读代码,或者承载有计算机可读代码的非易失性计算机可读存储介质,当所述计算机可读代码在电子设备的处理器中运行时,所述电子设备中的处理器执行如第一方面所述的方法。
35、本申请实施例中提供的技术方案,至少具有如下技术效果或优点:
36、本实施例提供的方案中,通过序列化训练样本,可以将训练样本转换成符合深度学习模型能够处理的序列格式,这样实现利用结构化数据对深度学习模型进行训练。与基于特征工程的结构化数据处理相比,本申请提案提出的方法无需手动进行特征设计和提取。这极大降低了数据预处理的复杂性,缩短了模型开发时间,并使模型更具泛化性。
37、本申请附加的方面和优点将在下面的描述中部分给出,部分将从下面的描述中变的明显,或通过本申请的实践了解到。
1.一种模型训练方法,其特征在于,包括:
2.根据权利要求1所述的方法,其特征在于,序列化所述训练样本,获得所述训练样本的输入特征序列,包括:
3.根据权利要求2所述的方法,其特征在于,基于所述深度学习模型中的多层感知机,将所述训练样本映射到预设维度的高维空间,获得高维特征序列,包括:
4.根据权利要求3所述的方法,其特征在于,采用所述多层感知机,将所述特征序列映射到所述预设维度的高维空间,获得所述高维特征序列,包括:
5.根据权利要求2所述的方法,其特征在于,向所述高维特征序列添加分类标记数据和位置编码数据,获得所述输入特征序列,包括:
6.根据权利要求1-5任一项所述的方法,其特征在于,利用所述目标分类标记数据,计算模型损失,包括:
7.根据权利要求1-5任一项所述的方法,其特征在于,序列化所述训练样本,获得所述训练样本的输入特征序列,包括:
8.一种模型训练装置,其特征在于,包括:
9.一种电子设备,包括存储器、处理器及存储在所述存储器上并可在所述处理器上运行的计算机程序,其特征在于,所述处理器运行所述计算机程序以实现如权利要求1-7任一项所述的方法。
10.一种计算机程序产品,其特征在于,包括计算机可读代码,或者承载有计算机可读代码的非易失性计算机可读存储介质,当所述计算机可读代码在电子设备的处理器中运行时,所述电子设备中的处理器执行如权利要求1-7中任一项所述的方法。
