本技术涉及目标检测领域,具体涉及一种目标检测模型的训练方法、目标检测方法及相关设备。
背景技术:
1、目标检测作为一项计算机视觉领域的基础任务,该任务以图像为输入,对图像中目标的类别和位置进行预测。
2、在传统的计算机视觉领域中,人工会对图像中目标物的位置及类别进行标注,形成训练集,利用训练集对目标检测网络进行训练。
3、训练后的目标检测网络虽然具备一定的检测能力,但是,该目标检测网络所能识别的目标物类别仅限于训练集中所标注的目标类别,难以对新出现的未知目标物类别进行识别。
技术实现思路
1、鉴于此,本技术实施例提供一种目标检测模型的训练方法、目标检测方法、电子设备及计算机可读存储介质,可以便于目标检测模型对新出现的未知目标物类别进行识别。
2、第一方面,本技术实施例提供一种目标检测模型的训练方法,所述目标检测模型用于识别图像中的目标物,所述训练方法包括:
3、获取用于对所述目标检测模型进行训练的样本图像,其中,所述目标检测模型中配置有与所述样本图像所属数据域对应的数据域向量;
4、获取所述目标物的类别向量;
5、将所述数据域向量与类别向量进行拼接,得到与所述数据域对应的文本提示向量,所述文本提示向量用于表征所述目标物在所述数据域中的图像语义特征;
6、基于所述目标检测模型在所述样本图像中提取所述目标物的候选区域;
7、基于所述目标检测模型计算所述文本提示向量和所述候选区域的相似度;
8、基于所述文本提示向量和所述候选区域的相似度确定目标检测结果;
9、获取所述样本图像的目标检测标签;
10、基于所述目标检测结果和所述目标检测标签确定目标检测损失;
11、基于所述目标检测损失更新所述数据域向量。
12、本技术实施例在目标检测网络中配置数据域向量,数据域向量在与类别向量拼接后得到的文本提示向量可以反应该类别的目标物在数据域中的图像语义特征,也即,文本提示向量可以引导目标检测模型识别该类别目标物,电子设备进一步将文本提示向量与数据域中样本图像的候选区域进行相似度计算,以此对数据域向量进行更新,使得数据域向量能够逐渐学习到不同目标物在数据域的共性语义特征,从而使得文本提示向量能够准确引导目标检测模型识别某类型的目标物,也即,目标检测模型可以基于不同目标物类别对应的文本提示向量实现对该类别的目标物的检测,便于目标检测模型对新出现的未知目标物类别进行识别。
13、在一些实施例中,样本图像包括属于源域的源域图像和属于目标域的目标域图像,所述源域和所述目标域属于不同的数据域;
14、所述源域的数据域向量包括域通用向量及源域私有向量;
15、所述目标域的数据域向量包括所述域通用向量及目标域私有向量;
16、所述目标检测损失包括源域损失和目标域损失,所述基于所述目标检测结果和所述目标检测标签确定目标检测损失,包括:
17、基于所述源域图像的目标检测结果和所述源域图像的目标检测标签确定源域损失;
18、基于所述目标域图像的目标检测结果和所述目标域图像的目标检测标签确定目标域损失;
19、所述基于所述目标检测损失更新所述数据域向量,包括:
20、基于所述源域损失更新所述源域私有向量;
21、基于所述目标域损失更新所述目标域私有向量;
22、基于所述源域损失和所述目标域损失更新所述域通用向量。
23、在该技术方案中,当样本图像包括多个数据域的图像时,将数据域向量分为各数据域共用的域通用向量和每个数据域独有的域私有向量,对域通用向量和该些域私有向量分别进行更新优化,有利于缩小不同数据域向量之间存在差异的数据的规模,提高模型训练时的效率。
24、在一些实施例中,目标域图像为无标签的样本图像,所述获取所述样本图像的目标检测标签,包括:
25、基于预设的视觉语言预训练大模型预测所述目标域图像中各候选区域的类别,得到所述候选区域的预测类别;
26、基于所述预测类别确定所述目标域图像的目标检测标签。
27、采用该技术方案,当目标域图像不存在标注标签的情况下,可以生成伪标签,使得目标检测模型能够学习该目标域图像中未标注区域,保障目标检测模型在目标域上的目标检测能力,还能降低人工标注成本。
28、在一些实施例中,基于所述目标域图像的目标检测结果和所述目标域图像的目标检测标签确定目标域损失,包括:
29、获取所述目标域图像的每个候选区域属于所述预测类别的预测概率,得到各预测概率;
30、在所述各预测概率中,筛选大于预设阈值的预测概率;
31、基于所述大于预设阈值的预测概率确定所述目标域损失。
32、采用该技术方案,当目标域图像没有标签的情况下,筛选大于预设阈值的预测概率所对应的预测类别作为伪标签,可以保障目标域损失计算的准确性,进而进一步保障目标检测模型在目标域上的检测能力。
33、在一些实施例中,在所述将所述数据域向量与类别向量进行拼接,得到与所述数据域对应的文本提示向量之后,所述训练方法还包括:
34、基于预设的域分类器和所述源域的文本提示向量进行域分类,得到源域分类结果;
35、其中,所述域分类器用于区分输入数据属于源域还是目标域;
36、基于所述域分类器和所述目标域的文本提示向量进行域分类,得到目标域分类结果;
37、基于所述源域分类结果和所述目标域分类结果,得到域分类损失;
38、所述基于所述源域损失和所述目标域损失更新所述域通用向量,包括:
39、基于所述源域损失和所述目标域损失进行梯度下降,及基于所述域分类损失进行梯度反转,得到更新后的域通用向量。
40、采用该技术方案,通过源域的文本提示向量和目标域的文本提示向量进行域分类,进而计算域分类损失,采用域分类损失进行梯度反转,使得域分类器和域通用向量形成对抗,有利于促进源域和目标域中共性特征的提取。
41、在一些实施例中,目标检测模型还包括文本编码器、视觉编码器及视觉语言对比模块,所述基于所述目标检测模型计算所述文本提示向量和所述候选区域的相似度,包括:
42、基于所述文本编码器对所述文本提示向量进行文本编码,得到文本编码特征;
43、基于所述视觉编码器对所述候选区域进行视觉编码,得到视觉编码特征;
44、基于所述视觉语言对比模块计算所述文本编码特征和所述视觉编码特征的相似度。
45、采用该技术方案,采用文本编码器和视觉编码器可以将文本提示向量和目标提示向量映射到同一特征空间,从而便于相似度的计算。
46、第二方面,本技术实施例还提供一种目标检测方法,包括:
47、获取待进行目标检测的图像;
48、获取所述图像的目标检测任务,所述目标检测任务包括待检测的目标物的类别;
49、基于所述目标检测任务确定类别向量;
50、基于预先训练的目标检测模型确定所述图像所属数据域的数据域向量;
51、将所述数据域向量与所述类别向量进行拼接,得到与所述数据域对应的文本提示向量,所述文本提示向量用于表征所述目标物在所述数据域中的图像语义特征;
52、基于所述目标检测模型在所述图像中提取所述目标物的候选区域;
53、基于所述目标检测模型计算所述文本提示向量和所述候选区域的相似度;
54、基于所述文本提示向量和所述候选区域的相似度得到目标检测结果。
55、在一些实施例中,所述目标检测结果包括所述候选区域中存在的目标物所属的目标物类别,所述基于所述文本提示向量和所述候选区域的相似度得到所述图像的目标检测结果,包括:
56、基于每个所述文本提示向量和所述候选区域的相似度,确定所述候选区域属于每个所述目标物类别的概率,得到各预测概率;
57、在所述各预测概率中,将最大的预测概率所对应的目标物类别作为所述候选区域存在的目标物所属的目标物类别。
58、本技术实施例还提供一种电子设备,所述电子设备包括处理器及存储器,所述存储器用于存储指令,所述处理器用于调用所述存储器中的指令,使得所述电子设备执行如第一方面所述的目标检测模型的训练方法,或者,执行第二方面所述的目标检测方法。
59、本技术实施例提供一种计算机可读存储介质,所述计算机可读存储介质存储计算机指令,当所述计算机指令在电子设备上运行时,使得所述电子设备执行如第一方面所述的目标检测模型的训练方法,或者,执行如第二方面所述的目标检测方法。
60、上述目标检测方法、电子设备及计算机可读存储介质均与上述目标检测网络的训练方法相对应,因此,其所能达到的有益效果可参考上文所提供的对应的方法中的有益效果,此处不再赘述。
1.一种目标检测模型的训练方法,其特征在于,所述目标检测模型用于识别图像中的目标物,所述训练方法包括:
2.如权利要求1所述的目标检测模型的训练方法,其特征在于,所述样本图像包括属于源域的源域图像和属于目标域的目标域图像,所述源域和所述目标域属于不同的数据域;
3.如权利要求2所述的目标检测模型的训练方法,其特征在于,所述目标域图像为无标签的样本图像,所述获取所述样本图像的目标检测标签,包括:
4.如权利要求3所述的目标检测模型的训练方法,其特征在于,基于所述目标域图像的目标检测结果和所述目标域图像的目标检测标签确定目标域损失,包括:
5.如权利要求2所述的目标检测模型的训练方法,其特征在于,在所述将所述数据域向量与类别向量进行拼接,得到与所述数据域对应的文本提示向量之后,所述训练方法还包括:
6.如权利要求1至5中任一项所述的目标检测模型的训练方法,其特征在于,所述目标检测模型还包括文本编码器、视觉编码器及视觉语言对比模块,所述基于所述目标检测模型计算所述文本提示向量和所述候选区域的相似度,包括:
7.一种目标检测方法,其特征在于,包括:
8.如权利要求7所述的目标检测方法,其特征在于,所述目标检测结果包括所述候选区域中存在的目标物所属的目标物类别,所述基于所述文本提示向量和所述候选区域的相似度得到所述图像的目标检测结果,包括:
9.一种电子设备,所述电子设备包括处理器及存储器,其特征在于,所述存储器用于存储指令,所述处理器用于调用所述存储器中的指令,使得所述电子设备执行如权利要求1至权利要求6中任一项所述的目标检测模型的训练方法,或者,执行如权利要求7至权利要求8中任一项所述的目标检测方法。
10.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质存储计算机指令,当所述计算机指令在电子设备上运行时,使得所述电子设备执行如权利要求1至权利要求6中任一项所述的目标检测模型的训练方法,或者,执行如权利要求7至权利要求8中任一项所述的目标检测方法。
