本发明涉及视频理解与分析技术,尤其是视频理解中的动作识别技术,具体是一种基于动态位置嵌入的课堂完备元动作识别方法。
背景技术:
1、线下课堂是学生学习与教师授课的主要场所,教学质量的优劣将直接影响学生的学习效果。随着智慧教室的发展,获取课堂中学生视频数据越来越容易。对此,引入视频动作识别技术对课堂里学生所做动作进行识别,即时感知学生的学习状态,并提供反映课堂质量的智能分析报告。课堂动作识别任务以学生动作视频帧序列作为输入,输出学生动作类别,在课堂授课、自修管理、无人监考等场景有广泛的应用。例如,在无人监考环境中,课堂动作识别技术能够实时识别考生的动作,若出现疑似作弊行为可对考生进行调查,从而确保考试纪律。目前主要挑战在于:不同学生的同一动作的幅度、频率不等增加识别难度、对多个学生进行动作识别需要大量计算开销等。
2、目前,针对课堂场景动作识别的实际应用较少,传统动作识别技术采用端到端学习框架方式,能够自动提取反映视频内容潜在语义信息的特征表示,此外,传统动作识别方法需将视频帧编码成手工特征(如hog3d、3dsurf等特征),但是手工特征存在很大的局限性且提取速度较慢无法满足实时性要求。近年来,以卷积神经网络cnn(convolutionalneural network,简称cnn)为核心的动作识别方法能端到端地学习反映视频潜在语义信息的特征表示,这样大幅提升了动作识别的准确率。为了提取更有效的视觉特征,残差网络(resnet)采用残差连接使得网络不同层相连,以缓解更深层神经网络模型训练时产生的过拟合、梯度消失或梯度爆炸等问题;非局部网络(non-local network)利用一种非局部操作捕获长距离依赖关系,通过注意力机制建立视频帧图像不同距离的像素块之间的联系,挖掘彼此间语义信息。除此之外,源于自然语言处理领域的变换器(transformer)模型近来风靡于计算机视觉领域,其多头注意力机制被用于提取视频帧序列中多样性的关键时序信息,使得模型能够学习更具辨识性的特征表示。
3、现有技术中课堂完备元动作识别技术仍然存在许多不足:首先,针对提取特征时对所有视频帧分块计算时空注意力,忽略了时空特征的局部特性使得识别率受限,且当视频分辨率较大时计算开销过大;其次,很多技术中采用的方法仅提取单一尺度分块的时空特征,难以适应动作发生的时空相关联系情况。为了解决缺少局部时空特征信息交换机制等问题,迫切需要一种既能提高局部空间结构理解力,又能捕捉全局时空特征信息,能提高学生课堂完备元动作识别准确率的方法。
技术实现思路
1、本发明的目的是针对现有技术的不足,而提供一种基于动态位置嵌入的课堂完备元动作识别方法。这种方法能提高局部空间结构理解力、能捕捉全局时空特征信息、能提高学生课堂完备元动作识别准确率。
2、实现本发明目的的技术方案是:
3、一种基于动态位置嵌入的课堂完备元动作识别方法,包括如下步骤:
4、1)首先获取高清课堂学生视频数据,对高清课堂学生视频数据进行预处理,得到单个学生课堂元动作视频;
5、2)对单个学生课堂元动作视频进行采样,采样帧率为8~32帧/视频,输入为学生动作视频帧序列,输出为学生动作关键视频帧;
6、3)构建基于动态位置嵌入的条件位置编码模块,输入为学生动作关键视频帧,输出为动态位置特征表示,包括:
7、3-1)动态位置嵌入如公式(1)所示:
8、dpe(x)=dwconv(x) (1);
9、3-2)公式(1)中dwconv表示卷积过程中采用零填充,使数据中的各个元素通过逐步探索其邻居信息来更好地理解在数据中的绝对位置,从而增强模型对空间结构的理解能力,x表示输入视频帧;
10、4)构建视频滑窗变换器video swin transformer基本块:输入为动态位置特征表示,输出为多个局部注意力向量,包括:
11、4-1)video swin transformer在transformer编码器中引入窗口注意力,实现层次结构、局部性和转换不变性,结合了基本transformer单元具有强大的建模能力并且降低了计算复杂度;
12、4-2)video swin transformer基本块先经过窗口自注意力3d w-msa计算,再经过规范化层ln,并且进行残差连接,然后进行mlp层与规范化层特征筛选,基于滑动窗口的注意力计算是一种移位窗口分区注意力计算方法,在连续的video swin transformer模块中交替采用两种分区配置,原理如公式(2)-公式(5)所示:
13、
14、公式(2)-公式(5)中,zl-1表示video swin transformer基本块输入;zl和zl+1是滑窗窗口自注意力计算及mlp(多层感知机)层输出的特征,采用滑动窗口的注意力计算可以关联前后帧的特征;3dw-msa表示3维窗口注意力计算;3dsw-msa表示3维带滑窗窗口注意力计算;ln表示规范化层;
15、5)构建vit3d基本块:输入为步骤4)输出的所有局部注意力向量,输出为元动作类别概率向量,包括:
16、5-1)vit3d模块是vit(visio transformer,简称vit)经过参数膨胀,将视频或者多张图片拼接成一组输入,使得模型深层特征图中所有小块patches进行完全注意力计算;
17、5-2)video swin transformer模块输出n张特征图后,输入到vit3d模块中的tansformer encoder进行完全注意力计算,提取每个像素块的注意力向量,原理如公式(6)所示:
18、
19、5-3)公式(6)中,q为query矩阵,表示当前的查询或问题,通常与当前处理的位置或元素相关;k为key矩阵,表示数据集中所有可能的键;v为value矩阵,表示与每个键相关联的值;kt表示k矩阵的转置;dk为key的维度;softmax函数,将输入的向量转换为概率分布,确保所有输出的权重加起来等于1;
20、5-4)每个像素块的注意力向量经过mlp head层进行分类,得到识别的课堂元动作;
21、6)构建由动态位置嵌入的位置编码模块、video swin transformer基本模块、vit3d基本模块组成的课堂完备元动作识别模型,并进行训练,训练采用video swintransformer模型框架,总迭代次数为10~1000轮,训练采用adamw优化器进行梯度下降优化,主干网络的学习率设置为3e-5,batch size设置为8~512;
22、7)对新的课堂学生元动作视频进行人体检测并得到单个学生课堂元动作视频,输入已经训练好的课堂完备元动作识别模型,输出课堂学生元动作类别。
23、本技术方案应用于线下智慧教室学生课堂元动作识别,具有以下几个特点:1)联合video swin transformer和vit3d的课堂元动作识别网络架构,该架构通过将videoswin transformer网络提取的深层特征输入到vit3d中进行全面的注意力计算,不仅增强了模型对动作细节的捕捉能力,还提升了对元动作整体结构的理解;2)在位置编码时采用动态位置嵌入方式,采用深度卷积技术,在卷积过程中引入零填充,使数据中的各个元素通过逐步探索其邻居信息来更好地理解在数据中的绝对位置,增强模型对动作视频的空间结构理解力,提高模型对动作时空特征的局部捕捉能力;3)本技术方案在各类动作识别场景中有很高的有效性和可靠性,为智慧教育和行为分析领域提供了一种新的技术手段。
24、这种方法能提高局部空间结构理解力、能捕捉全局时空特征信息、能提高学生课堂完备元动作识别准确率。
1.一种基于动态位置嵌入的课堂完备元动作识别方法,其特征在于,包括如下步骤:
