本公开涉及计算机,尤其涉及一种语音表征模型训练方法、装置及相关设备。
背景技术:
1、语音处理包含多种任务,其可以包括基于语音表征模型执行的语音转换(voiceconversion,vc)、语音识别(automatic speech recognition,asr)、语音合成(text-to-speech,tts)等细粒度的语音处理任务,语音表征模型的性能对于这些细粒度的语音处理任务的任务执行结果有重大影响。但是,相关技术中训练得到的语音表征模型的表征能力不强,从而导致语音表征模型无法较好地适用于细粒度的语音识别任务。
技术实现思路
1、本公开提供一种语音表征模型训练方法、装置及相关设备,以至少解决相关技术中的至少一种问题。本公开的技术方案如下:
2、根据本公开实施例的第一方面,提供一种语音表征模型训练方法,包括:
3、获取样本文本以及样本语音对应的样本梅尔谱,所述样本语音和所述样本文本相匹配;对所述样本文本进行音素提取,得到所述样本文本对应的样本音素序列;
4、通过初始模型的音素编码器,对所述样本音素序列进行编码处理,得到样本音素特征;通过所述初始模型的语音编码器,对所述样本梅尔谱进行编码处理,得到样本语音特征;
5、对所述样本语音特征进行量化处理,得到样本语音量化特征;对所述样本梅尔谱进行截取处理,得到提示梅尔谱;
6、通过所述初始模型的提示编码器,对所述提示梅尔谱进行编码处理,得到样本提示特征;
7、通过所述初始模型的语音解码器,基于所述样本提示特征对所述样本语音量化特征进行解码处理,得到预测梅尔谱;
8、通过所述初始模型的音素解码器,对所述样本语音量化特征进行解码处理,得到预测音素序列;
9、基于模型损失,训练所述初始模型,得到语音表征模型;其中,所述模型损失包括第一损失和第二损失;所述第一损失为基于所述预测梅尔谱和所述样本梅尔谱的差异确定的损失,所述第二损失为基于所述样本音素序列和所述预测音素序列的差异确定的损失。
10、在一些实施方式中,所述对所述样本文本进行音素提取,得到所述样本文本对应的样本音素序列,包括:
11、解析所述样本文本中的音素,得到初始音素序列;
12、获取所述样本文本对应的音素样本时长;
13、基于所述音素样本时长调整所述初始音素序列的长度,得到所述样本音素序列,所述样本音素序列的长度与所述样本语音的长度一致。
14、在一些实施方式中,所述音素样本时长包括所述样本文本中的每个音素在所述样本语音中的持续时长,所述基于所述音素样本时长调整所述初始音素序列的长度,得到所述样本音素序列,包括:
15、基于所述每个音素在所述样本语音中的持续时长,对所述初始音素序列进行上采样,得到所述样本音素序列。
16、在一些实施方式中,所述模型损失还包括第三损失,所述第三损失用于指示所述样本音素特征与所述样本语音特征之间的差异。
17、在一些实施方式中,所述第三损失通过下述方法得到:
18、对所述样本音素特征和所述样本语音特征分别进行降维处理,得到音素样本编码向量和语音样本编码向量,所述音素样本编码向量中的音素样本编码的数量与所述语音样本编码向量中的语音样本编码的数量相同;
19、基于所述音素样本编码向量和所述语音样本编码向量,构建音素语音编码矩阵;第一位置对应的音素样本编码和所述第一位置对应的语音样本编码构成正样本对,第二位置对应的音素样本编码和所述第二位置对应的语音样本编码构成负样本对,所述第一位置为所述音素语音编码矩阵中行号和列号相同的位置,所述第二位置为所述音素语音编码矩阵中除去所述第一位置外的其他位置;
20、基于所述正样本对和所述负样本对进行对比学习,构建所述第三损失。
21、在一些实施方式中,所述模型损失还包括第四损失,所述第四损失为对所述样本语音特征进行量化所产生的量化损失。
22、在一些实施方式中,所述方法还包括:
23、基于所述预测梅尔谱和所述样本梅尔谱,计算均方差损失;
24、基于所述均方差损失,确定所述第一损失。
25、在一些实施方式中,所述方法还包括:
26、基于所述样本音素序列和所述预测音素序列,计算交叉熵损失;
27、基于所述交叉熵损失,确定所述第二损失。
28、在一些实施方式中,所述对所述样本梅尔谱进行截取处理,得到提示梅尔谱,包括:
29、随机对所述样本梅尔谱进行截取,得到预设长度的梅尔谱;
30、将所述预设长度的梅尔谱作为所述提示梅尔谱。
31、根据本公开实施例的第二方面,提供一种语音表征模型训练装置,包括:
32、样本获取模块,被配置为执行获取样本文本以及样本语音对应的样本梅尔谱,所述样本语音和所述样本文本相匹配;
33、音素提取模块,被配置为执行对所述样本文本进行音素提取,得到所述样本文本对应的样本音素序列;
34、编码模块,被配置为执行通过初始模型的音素编码器,对所述样本音素序列进行编码处理,得到样本音素特征;以及,通过所述初始模型的语音编码器,对所述样本梅尔谱进行编码处理,得到样本语音特征;
35、量化模块,被配置为执行对所述样本语音特征进行量化处理,得到样本语音量化特征;
36、提示特征提取模块,被配置为执行对所述样本梅尔谱进行截取处理,得到提示梅尔谱;通过所述初始模型的提示编码器,对所述提示梅尔谱进行编码处理,得到样本提示特征;
37、解码模块,被配置为执行通过所述初始模型的语音解码器,基于所述样本提示特征对所述样本语音量化特征进行解码处理,得到预测梅尔谱;以及,通过所述初始模型的音素解码器,对所述样本语音量化特征进行解码处理,得到预测音素序列;
38、训练模块,被配置为执行基于模型损失,训练所述初始模型,得到语音表征模型;其中,所述模型损失包括第一损失和第二损失;所述第一损失为基于所述预测梅尔谱和所述样本梅尔谱的差异确定的损失,所述第二损失为基于所述样本音素序列和所述预测音素序列的差异确定的损失。
39、在一些实施方式中,所述音素提取模块,被配置为执行:
40、解析所述样本文本中的音素,得到初始音素序列;
41、获取所述样本文本对应的音素样本时长;
42、基于所述音素样本时长调整所述初始音素序列的长度,得到所述样本音素序列,所述样本音素序列的长度与所述样本语音的长度一致。
43、在一些实施方式中,所述音素样本时长包括所述样本文本中的每个音素在所述样本语音中的持续时长,所述音素提取模块,被配置为执行:
44、基于所述每个音素在所述样本语音中的持续时长,对所述初始音素序列进行上采样,得到所述样本音素序列。
45、在一些实施方式中,所述模型损失还包括第三损失,所述第三损失用于指示所述样本音素特征与所述样本语音特征之间的差异。
46、在一些实施方式中,所述训练模块,被配置为执行:
47、对所述样本音素特征和所述样本语音特征分别进行降维处理,得到音素样本编码向量和语音样本编码向量,所述音素样本编码向量中的音素样本编码的数量与所述语音样本编码向量中的语音样本编码的数量相同;
48、基于所述音素样本编码向量和所述语音样本编码向量,构建音素语音编码矩阵;第一位置对应的音素样本编码和所述第一位置对应的语音样本编码构成正样本对,第二位置对应的音素样本编码和所述第二位置对应的语音样本编码构成负样本对,所述第一位置为所述音素语音编码矩阵中行号和列号相同的位置,所述第二位置为所述音素语音编码矩阵中除去所述第一位置外的其他位置;
49、基于所述正样本对和所述负样本对进行对比学习,构建所述第三损失。
50、在一些实施方式中,所述模型损失还包括第四损失,所述第四损失为对所述样本语音特征进行量化所产生的量化损失。
51、在一些实施方式中,所述训练模块,被配置为执行:
52、基于所述预测梅尔谱和所述样本梅尔谱,计算均方差损失;
53、基于所述均方差损失,确定所述第一损失。
54、在一些实施方式中,所述训练模块,被配置为执行:
55、基于所述样本音素序列和所述预测音素序列,计算交叉熵损失;
56、基于所述交叉熵损失,确定所述第二损失。
57、在一些实施方式中,所述提示特征提取模块,被配置为执行:
58、随机对所述样本梅尔谱进行截取,得到预设长度的梅尔谱;
59、将所述预设长度的梅尔谱作为所述提示梅尔谱。
60、根据本公开实施例的第三方面,提供一种电子设备,包括:
61、处理器;
62、用于存储所述处理器可执行指令的存储器;其中,所述处理器被配置为执行所述指令,以实现如上述任一实施方式所述的语音表征模型训练方法。
63、根据本公开实施例的第四方面,提供一种计算机存储介质,当所述计算机存储介质中的指令由电子设备的处理器执行时,使得所述电子设备执行上述任一实施方式中所述的语音表征模型训练方法。
64、根据本公开实施例的第五方面,提供一种计算机程序产品,该计算机程序产品包括计算机程序,该计算机程序被处理器执行时实现上述任一种实施方式中所述的语音表征模型训练方法。
65、本公开的实施例提供的技术方案至少带来以下有益效果:
66、本公开实施例可以获取样本文本以及样本语音对应的样本梅尔谱,样本语音和样本文本相匹配;对样本文本进行音素提取,得到样本文本对应的样本音素序列;通过初始模型的音素编码器,对样本音素序列进行编码处理,得到样本音素特征;通过初始模型的语音编码器,对样本梅尔谱进行编码处理,得到样本语音特征;对样本语音特征进行量化处理,得到样本语音量化特征;对样本梅尔谱进行截取处理,得到提示梅尔谱;通过初始模型的提示编码器,对提示梅尔谱进行编码处理,得到样本提示特征;通过初始模型的语音解码器,基于样本提示特征对样本语音量化特征进行解码处理,得到预测梅尔谱;通过初始模型的音素解码器,基于样本提示特征对样本语音量化特征进行解码处理,得到预测音素序列;基于模型损失,训练初始模型,得到语音表征模型。如此,经训练的语音表征模型包含音素编码器、提示编码器和语音编码器这三个编码器,还包括音素解码器和语音解码器这两个解码器,该语音表征模型实质上的训练过程体现了一种跨模态联合学习。通过利用语音编码器和音素编码器将音素和语音带入一个联合的多模态空间,从而促进音素和语音的特征连接,进而提升了语音表征模型的语音表征能力,也提升了语音表征模型输出的语音表征的质量。
67、应当理解的是,以上的一般描述和后文的细节描述仅是示例性和解释性的,并不能限制本公开。
1.一种语音表征模型训练方法,其特征在于,包括:
2.根据权利要求1所述的方法,其特征在于,所述对所述样本文本进行音素提取,得到所述样本文本对应的样本音素序列,包括:
3.根据权利要求2所述的方法,其特征在于,所述音素样本时长包括所述样本文本中的每个音素在所述样本语音中的持续时长,所述基于所述音素样本时长调整所述初始音素序列的长度,得到所述样本音素序列,包括:
4.根据权利要求1至3中任意一项所述的方法,其特征在于,所述模型损失还包括第三损失,所述第三损失用于指示所述样本音素特征与所述样本语音特征之间的差异。
5.根据权利要求4所述的方法,其特征在于,所述第三损失通过下述方法得到:
6.根据权利要求1所述的方法,其特征在于,所述模型损失还包括第四损失,所述第四损失为对所述样本语音特征进行量化所产生的量化损失。
7.根据权利要求1所述的方法,其特征在于,所述方法还包括:
8.根据权利要求1所述的方法,其特征在于,所述方法还包括:
9.根据权利要求1所述的方法,其特征在于,所述对所述样本梅尔谱进行截取处理,得到提示梅尔谱,包括:
10.一种语音表征模型训练装置,其特征在于,包括:
11.一种电子设备,其特征在于,包括:
12.一种计算机可读存储介质,其特征在于,当所述计算机可读存储介质中的指令由电子设备的处理器执行时,使得所述电子设备执行如权利要求1-9中任一所述的方法。
13.一种计算机程序产品,其特征在于,所述计算机程序产品包括计算机程序,所述计算机程序存储在可读存储介质中,计算机设备的至少一个处理器从所述可读存储介质读取并执行所述计算机程序,使得设备执行如权利要求1至9中任一项所述的方法。
