本申请涉及人工智能,尤其涉及一种文本分类方法、分类装置及电子设备。
背景技术:
1、自然语言处理(natural language processing,nlp)是人工智能的一个重要分支,它研究如何让计算机理解和生成人类语言。文本分类是自然语言处理中的一个重要任务,它的目标是将文本文档归类到预先定义的类别中。
2、现有的长文本分类技术在处理分类问题时,特别是一些类之间的边界较近多分类问题时,分类精度可能较低。
技术实现思路
1、有鉴于此,本申请实施例提供了一种文本分类方法、分类装置及电子设备,以解决现有技术中分类精度不高的问题。
2、本申请实施例的第一方面,提供了一种文本分类方法,包括:
3、获取目标文本;
4、根据分词量和词频,得到目标文本的第一特征;
5、将目标文本与预先构建的第一目标双数组匹配,得到目标文本的第二特征,该第二特征包括目标文本的实体特征和实体类型特征;
6、基于第一特征和第二特征进行特征融合,得到第一目标特征向量;
7、使用分类器对第一目标特征向量分类,得到目标文本的分类结果,分类结果包括目标文本的类别。
8、本申请实施例的第二方面,提供了一种文本分类装置,包括:
9、获取模块,被配置为获取目标文本;
10、特征提取模块,被配置为根据分词量和词频,得到目标文本的第一特征;
11、特征提取模块还被配置为将目标文本与预先构建的第一目标双数组匹配,得到目标文本的第二特征,该第二特征包括目标文本的实体特征和实体类型特征;
12、向量拼接模块,被配置为基于第一特征和第二特征进行特征融合,得到第一目标特征向量;
13、分类模块,被配置为使用分类器对第一目标特征向量进行分类,得到目标文本的分类结果,分类结果包括目标文本的类别。
14、本申请实施例的第三方面,提供了一种电子设备,包括存储器、处理器以及存储在存储器中并且可在处理器上运行的计算机程序,该处理器执行计算机程序时实现上述方法的步骤。
15、本申请实施例与现有技术相比存在的有益效果是:本申请实施例通过对目标文本分别根据分词量和词频提取第一特征,以及通过与预先构建的第一目标双数组匹配得到包括目标文本实体特征和实体类型特征的第二特征,再将第一特征和第二特征融合后,利用分类器和融合得到的第一目标特征向量分类得到目标文本的类别,能够得到较高精度的分类结果。
1.一种文本分类方法,其特征在于,包括:
2.根据权利要求1所述的方法,其特征在于,所述第一目标双数组采用如下方式构建:
3.根据权利要求2所述的方法,其特征在于,所述第一目标双数组还包括检查数组;
4.根据权利要求3所述的方法,其特征在于,所述trie树的根节点对应所述第一目标双数组的基础数组和检查数组中的第一个数组元素;
5.根据权利要求3所述的方法,其特征在于,所述根据各实体的编码值计算得到各子节点对应的基础数组值和检查数组值,包括:
6.根据权利要求5所述的方法,其特征在于,
7.根据权利要求1所述的方法,其特征在于,所述基于所述第一特征和所述第二特征进行特征融合,得到第一目标特征向量,包括:
8.根据权利要求1所述的方法,其特征在于,所述分类器为初始化分类器,或者对初始化分类器进行训练后的分类器;
9.一种文本分类装置,其特征在于,包括:
10.一种电子设备,包括存储器、处理器以及存储在所述存储器中并且可在所述处理器上运行的计算机程序,其特征在于,所述处理器执行所述计算机程序时实现如权利要求1至8中任一项所述方法的步骤。
