本申请涉及人工智能,特别是涉及一种增译数据识别方法、装置、计算机设备、存储介质和计算机程序产品。
背景技术:
1、随着人工智能技术的发展,以及对各类翻译程序、网站或系统的翻译效率和准确性的要求日益提升,出现了基于深度神经网络模型进行训练,获得机器翻译模型,并将机器翻译模型应用于翻译程序的方式。在模型训练过程中,为保证训练得到的机器翻译模型的模型精度、以及翻译结果准确度,需要大量的训练语料数据,且对训练语料数据的质量要求较高。
2、然而,传统的模型训练过程中,大部分的训练语料数据通常是通过网络爬虫工具进行获取的,且由于不同语言的文本表述方式不同,比如对于命名实体的翻译,在外文比如英语、俄文等语言的文本中,存在命名实体名称缺省的情况,比如出现只翻译人名中的姓的情况,因此仍然存在不同语言中语料数据不对等、命名实体增译的问题。
3、因此,在模型训练过程中,对不同语言的翻译模型使用同一份训练语料数据时,由于语料数据不对导致的命名实体增译的问题,仍存在较多无效数据或翻译错误的情况,利用存在较多错误数据的训练语料数据训练得到的翻译模型,仍然存在翻译结果准确度低下的问题。
技术实现思路
1、基于此,有必要针对上述技术问题,提供一种能够提升翻译结果准确度的增译数据识别方法、装置、计算机设备、计算机可读存储介质和计算机程序产品。
2、第一方面,本申请提供了一种增译数据识别方法。所述方法包括:
3、获取待识别语料数据,并基于所述待识别语料数据的第一端进行命名实体识别处理,获得对应的命名实体识别结果;
4、若在所述待识别语料数据的第二端,不存在与所述命名实体识别结果的翻译结果匹配的目标命名实体,确定与所述待识别语料数据对应的命名实体识别比率;
5、若所述命名实体识别比率满足增译识别处理条件,基于所述待识别语料数据的第二端进行增译数据识别处理,获得对应的增译数据识别结果;
6、根据所述命名实体识别比率和增译数据识别结果,对所述待识别语料数据进行数据筛选,获得目标语料数据;所述目标语料数据用于对初始翻译模型进行训练,获得训练好的翻译模型。
7、第二方面,本申请还提供了一种增译数据识别装置。所述装置包括:
8、命名实体识别处理模块,用于获取待识别语料数据,并基于所述待识别语料数据的第一端进行命名实体识别处理,获得对应的命名实体识别结果;
9、命名实体识别比率确定模块,用于若在所述待识别语料数据的第二端,不存在与所述命名实体识别结果的翻译结果匹配的目标命名实体,确定与所述待识别语料数据对应的命名实体识别比率;
10、增译数据识别处理模块,用于若所述命名实体识别比率满足增译识别处理条件,基于所述待识别语料数据的第二端进行增译数据识别处理,获得对应的增译数据识别结果;
11、目标语料数据获得模块,用于根据所述命名实体识别比率和增译数据识别结果,对所述待识别语料数据进行数据筛选,获得目标语料数据;所述目标语料数据用于对初始翻译模型进行训练,获得训练好的翻译模型。
12、第三方面,本申请还提供了一种计算机设备。所述计算机设备包括存储器和处理器,所述存储器存储有计算机程序,所述处理器执行所述计算机程序时实现以下步骤:
13、获取待识别语料数据,并基于所述待识别语料数据的第一端进行命名实体识别处理,获得对应的命名实体识别结果;
14、若在所述待识别语料数据的第二端,不存在与所述命名实体识别结果的翻译结果匹配的目标命名实体,确定与所述待识别语料数据对应的命名实体识别比率;
15、若所述命名实体识别比率满足增译识别处理条件,基于所述待识别语料数据的第二端进行增译数据识别处理,获得对应的增译数据识别结果;
16、根据所述命名实体识别比率和增译数据识别结果,对所述待识别语料数据进行数据筛选,获得目标语料数据;所述目标语料数据用于对初始翻译模型进行训练,获得训练好的翻译模型。
17、第四方面,本申请还提供了一种计算机可读存储介质。所述计算机可读存储介质,其上存储有计算机程序,所述计算机程序被处理器执行时实现以下步骤:
18、获取待识别语料数据,并基于所述待识别语料数据的第一端进行命名实体识别处理,获得对应的命名实体识别结果;
19、若在所述待识别语料数据的第二端,不存在与所述命名实体识别结果的翻译结果匹配的目标命名实体,确定与所述待识别语料数据对应的命名实体识别比率;
20、若所述命名实体识别比率满足增译识别处理条件,基于所述待识别语料数据的第二端进行增译数据识别处理,获得对应的增译数据识别结果;
21、根据所述命名实体识别比率和增译数据识别结果,对所述待识别语料数据进行数据筛选,获得目标语料数据;所述目标语料数据用于对初始翻译模型进行训练,获得训练好的翻译模型。
22、第五方面,本申请还提供了一种计算机程序产品。所述计算机程序产品,包括计算机程序,该计算机程序被处理器执行时实现以下步骤:
23、获取待识别语料数据,并基于所述待识别语料数据的第一端进行命名实体识别处理,获得对应的命名实体识别结果;
24、若在所述待识别语料数据的第二端,不存在与所述命名实体识别结果的翻译结果匹配的目标命名实体,确定与所述待识别语料数据对应的命名实体识别比率;
25、若所述命名实体识别比率满足增译识别处理条件,基于所述待识别语料数据的第二端进行增译数据识别处理,获得对应的增译数据识别结果;
26、根据所述命名实体识别比率和增译数据识别结果,对所述待识别语料数据进行数据筛选,获得目标语料数据;所述目标语料数据用于对初始翻译模型进行训练,获得训练好的翻译模型。
27、上述增译数据识别方法、装置、计算机设备、存储介质和计算机程序产品中,通过获取待识别语料数据,并基于待识别语料数据的第一端进行命名实体识别处理,获得对应的命名实体识别结果。其中,若在待识别语料数据的第二端,不存在与命名实体识别结果的翻译结果匹配的目标命名实体,确定与待识别语料数据对应的命名实体识别比率,通过确定出命名实体识别比率,以减少命名实体识别结果的误差,避免出现存在组合歧义的命名实体。进一步地,若命名实体识别比率满足增译识别处理条件,则基于待识别语料数据的第二端进行增译数据识别处理,获得对应的增译数据识别结果,并根据命名实体识别比率和增译数据识别结果,对待识别语料数据进行数据筛选,获得目标语料数据,实现了通过多层次的识别、筛选处理,准确识别出待识别语料数据中的增译数据,最终可根据筛选得到的目标语料数据对初始翻译模型进行训练,获得训练好的翻译模型,减少了模型训练过程中的增译数据和误差数据,提升了训练得到的翻译模型的模型精度、以及翻译结果准确度。
1.一种增译数据识别方法,其特征在于,所述方法包括:
2.根据权利要求1所述的方法,其特征在于,在所述获取待识别语料数据,并基于待识别语料数据的第一端进行命名实体识别处理,获得对应的命名实体识别结果之后,还包括:
3.根据权利要求2所述的方法,其特征在于,在所述若在所述待识别语料数据的第二端,不存在与所述命名实体识别结果的翻译结果匹配的目标命名实体,确定与所述待识别语料数据对应的命名实体识别比率之前,还包括:
4.根据权利要求1至3任意一项所述的方法,其特征在于,在所述若在所述待识别语料数据的第二端,不存在与所述命名实体识别结果匹配的翻译数据,确定与所述待识别语料数据对应的命名实体识别比率之后,还包括:
5.根据权利要求4所述的方法,其特征在于,根据所述命名实体识别比率,对所述待识别语料数据进行数据筛选,获得目标语料数据,包括:
6.根据权利要求1至3任意一项所述的方法,其特征在于,根据所述增译数据识别结果,对所述待识别语料数据进行数据筛选,获得目标语料数据,包括:
7.根据权利要求1至3任意一项所述的方法,其特征在于,确定与所述待识别语料数据对应的命名实体识别比率,包括:
8.一种增译数据识别装置,其特征在于,所述装置包括:
9.一种计算机设备,包括存储器和处理器,所述存储器存储有计算机程序,其特征在于,所述处理器执行所述计算机程序时实现权利要求1至7中任一项所述的方法的步骤。
10.一种计算机可读存储介质,其上存储有计算机程序,其特征在于,所述计算机程序被处理器执行时实现权利要求1至7中任一项所述的方法的步骤。
11.一种计算机程序产品,包括计算机程序,其特征在于,该计算机程序被处理器执行时实现权利要求1至7中任一项所述的方法的步骤。
