本发明涉及骨骼点动作识别领域,特别是涉及一种用于人体骨骼点动作识别的潜在空间矢量量化的掩蔽自编码器。
背景技术:
1、现有的人体骨骼点动作识别多采用监督学习的方式,但监督学习容易出现过拟合的问题,所以自监督学习方法快速发展起来。mae(掩蔽自编码器)在图像领域的大获成功,引得其他领域也注意到了掩蔽重建的自监督学习方法。在骨骼点动作识别领域,skeletonmae率先引入掩蔽重建,其网络结构如下图5,其中,(a)是skeletonmae的预训练过程,将骨骼点进行随机掩蔽,未掩蔽的部分输入进编码器编码,然后将编码后的特征向量补充上可学习的参数一起送入解码器,重建出和原始人体骨骼点一致的人体骨骼点数据。(b)是对编码器进行下游动作分类的微调。(c)是编码器结构,由一层输入层和8层sttablock组成。(d)是解码器结构,由8层sttablock和一层输出层组成。(e)是sttablock结构,它来自sttformer的block。
2、skeletonmae采用了编码器-解码器结构。编码器-解码器结构的潜在空间是连续的。连续表示限制了模型学习更通用、更抽象的特征表示,这可能导致模型对看不见的数据的泛化能力受到限制。因此,要提高下游分类任务的准确率和模型泛化性,需要让模型学习到更通用,更泛化的特征。
3、此外,skeletonmae在面对无损数据时能有很好的分类表现。但在面对缺损数据时,即使很小比例的缺损也会导致分类准确度急速下降,随着缺损的比例增加,它的分类效果下降到不可忍受的地步。
技术实现思路
1、针对现有技术不足,本发明的目的在于提供一种新的掩蔽重建自监督模型,使其提高在下游人体骨骼点动作分类任务中的准确率,和少标签半监督的泛化性,此外,在面对缺损数据时,能够先恢复缺损的部分,在对其分类,解决直接分类缺损数据表现力差的问题。
2、本发明提供如下技术方案:
3、一种用于人体骨骼点动作识别的潜在空间矢量量化的掩蔽自编码器,包括
4、编码器,所述编码器包括一层全连接输入层和8层sttf块;
5、离散表示模块,通过在潜在空间引入离散表示,用于捕捉数据中的抽象特征,通过引入离散元素,将连续表示空间转换为离散表示空间,提高模型对数据的建模能力;
6、解码器,所述解码器包括6层sttf块和一层全连接输出层。
7、一种掩蔽自编码器的工作方法,应用于上述的一种用于人体骨骼点动作识别的潜在空间矢量量化的掩蔽自编码器,包括以下步骤:
8、s1,选用ntu-rgb+d 60数据集和ntu-rgb+d 120数据集作为实验数据集;
9、s2,将数据集中的骨骼点数据传入掩蔽自编码器,掩蔽自编码器首先对传入的数据进行时间上的随机掩蔽,按照选定的比例随机抽取几帧进行删除,然后对剩余的时间帧进行空间上的掩蔽,按照选定的比例随机选取每帧中的骨骼点进行删除;
10、s3,将经过掩蔽的骨骼点进行重建预训练,未被掩蔽的数据经过编码器进行特征提取;
11、s4,未被掩蔽的数据经过编码器编码后,通过和codebook进行最近邻搜索,将编码向量换成与codebook中距离最近的码,得到真正的潜在向量;
12、s5,将可学习参数加入到数据中被掩蔽的部分,输入到解码器中进行解码重建;
13、s6,将完整的训练集数据进行下游分类任务微调,仅使用上述预训练过程的编码器,在编码器后只加一层全连接层进行分类。
14、进一步地,所述ntu-rgb+d 60数据集包括60个动作类别和56578个数据动作。
15、进一步地,所述ntu-rgb+d 120数据集在ntu-rgb+d 60数据集的基础上增加了60个动作类别,包括113945个动作数据。
16、进一步地,所述数据集中的每一个动作包括一系列的骨骼动作帧,且每一帧最多包含两个骨架,每个骨架有25个骨骼关节点,每个骨骼节点都有对应的三维空间坐标数据。
17、进一步地,所述ntu-rgb+d 60数据集的训练集和测试集有两种划分方式,分别为跨目标方式和跨视角方式;所述ntu-rgb+d 120数据集的训练集和测试集有两种划分方式,分别为跨目标方式和跨集合方式。
18、进一步地,所述ntu-rgb+d 60数据集和ntu-rgb+d 120数据集均使用adam优化策略,且初始学习率和权重衰减率分别为0.01和0.0001,批量大小在两个数据集上为64;学习率衰减策略是在第20、90和110epoch分别除以10,训练次数设置为200epoch。
19、进一步地,步骤s6中,微调过程的损失函数使用交叉熵损失函数。
20、与现有技术相比,本发明具有以下有益效果:
21、(1)本发明一种用于人体骨骼点动作识别的潜在空间矢量量化的掩蔽自编码器,不同潜在空间的自编码器特征表示能力不同,传统的编码器-自编码器结构潜在空间以连续的点表示,限制了编码器的特征表示能力,本发明将潜在空间离散化,由于码本中的每个码字都代表了输入数据中的一类特征,因此vq-vae能够学习到更加紧凑和具有区分性的特征表示,此外这种离散的特征表示具有更强的鲁棒性和可解释性,能够在一定程度上抵抗噪声和干扰的影响。
22、(2)本发明一种用于人体骨骼点动作识别的潜在空间矢量量化的掩蔽自编码器,仅使用微调的编码器对缺损数据进行分类并不能达到良好的分类效果,本发明使用vqvae进行掩蔽重建的预训练,发挥了vqvae的优良生成能力,使得它可以对我们缺损的数据进行恢复,提高后续分类的准确度。
1.一种用于人体骨骼点动作识别的潜在空间矢量量化的掩蔽自编码器,其特征在于,包括编码器,所述编码器包括一层全连接输入层和8层sttf块;
2.一种掩蔽自编码器的工作方法,应用于如权利要求1所述的一种用于人体骨骼点动作识别的潜在空间矢量量化的掩蔽自编码器,其特征在于,包括以下步骤:
3.根据权利要求2所述一种掩蔽自编码器的工作方法,其特征在于,所述ntu-rgb+d 60数据集包括60个动作类别和56578个数据动作。
4.根据权利要求3所述一种掩蔽自编码器的工作方法,其特征在于,所述ntu-rgb+d120数据集在ntu-rgb+d 60数据集的基础上增加了60个动作类别,包括113945个动作数据。
5.根据权利要求4所述一种掩蔽自编码器的工作方法,其特征在于,所述数据集中的每一个动作包括一系列的骨骼动作帧,且每一帧最多包含两个骨架,每个骨架有25个骨骼关节点,每个骨骼节点都有对应的三维空间坐标数据。
6.根据权利要求5所述一种掩蔽自编码器的工作方法,其特征在于,所述ntu-rgb+d 60数据集的训练集和测试集有两种划分方式,分别为跨目标方式和跨视角方式;所述ntu-rgb+d 120数据集的训练集和测试集有两种划分方式,分别为跨目标方式和跨集合方式。
7.根据权利要求6所述一种掩蔽自编码器的工作方法,其特征在于,所述ntu-rgb+d 60数据集和ntu-rgb+d 120数据集均使用adam优化策略,且初始学习率和权重衰减率分别为0.01和0.0001,批量大小在两个数据集上为64;学习率衰减策略是在第20、90和110epoch分别除以10,训练次数设置为200epoch。
8.根据权利要求2所述一种掩蔽自编码器的工作方法,其特征在于,步骤s6中,微调过程的损失函数使用交叉熵损失函数。
