一种基于深度哈希的特征提取检索方法和装置

    技术2026-06-19  21


    本发明涉及深度学习图像处理,特别是涉及一种基于深度哈希的特征提取检索方法和装置。


    背景技术:

    1、随着电子通信技术的飞速发展,互联网上的信息量成倍增长。每秒钟,数以百万计的图像被用户传送到各种海量存储设备中,这给图像检索领域带来了巨大的挑战。

    2、当给定查询图像时,大规模图像检索的任务是利用图像特征从百万级别的图像数据库中快速找到一定数量的图像。传统的基于树的检索方法通常使用复杂度较高的相似性度量,如欧氏距离,来计算特征之间的距离,在处理低维数据时表现出良好的性能。然而,当数据量达到上百万甚至上亿,特征维度越来越高时,容易产生维数灾难,计算效率急剧下降。为此,提出了一种基于哈希编码的近似最近邻(ann)搜索方法,该方法将原始空间中的高维向量转化为汉明空间中的二进制编码。此外,哈希码由于比特数少,距离计算简单,可以显著提高存储和检索效率。通常,哈希学习的目标是生成保持原始数据相似性的二进制编码。

    3、近年来,基于深度学习的哈希方法由于其在特征表示和哈希编码上有效的端到端学习而被广泛应用于anns中,其目的是利用深度神经网络学习非线性哈希映射。相关研究人员尝试将深度神经网络(例如,卷积神经网络,图卷积网络和生成对抗网络)引入到哈希学习中,在共享的端到端框架内将特征提取和哈希学习相结合,比传统的哈希方法具有更优越的性能。更具体地说,成对损失的深度哈希通常计算样本对之间的相似性信息来生成相似/不相似的紧凑码,通过联合探索类内相似性和类间相似性。

    4、目前深度学习哈希检索领域的主流做法与其他深度学习领域做法类似。输入训练图像,让图像经过一系列的神经网络,得到目标输出,检测目标输出与实际标签的差别,不断地迭代,以达到最小的训练损失。然而,现有算法存在以下两个问题:(1)训练图像的数量很多、种类很杂,图像经过网络模型的收敛速度必定会很慢;(2)图像在进行网络训练时,其整个逻辑都是按照标签与网络的输出进行loss逼近的,忽视了图像自身可能存在的高层特征,而这些高层特征可能对于检索的效率来说更加重要。


    技术实现思路

    1、本发明提供一种基于深度哈希的特征提取检索方法和装置,解决网络模型训练时间较长、收敛速度较慢的问题。

    2、本发明解决其技术问题所采用的技术方案是:提供一种基于深度哈希的特征提取检索方法,包括以下步骤:

    3、接收待查询图像;

    4、提取所述待查询图像的主体内容,并将所述待查询图像中的非主体内容用黑色像素代替,得到输入图像;

    5、将所述输入图像输入训练好的神经网络模型,得到检索结果;其中,

    6、所述神经网络模型包括:

    7、骨干网络部分,用于提取输入图像的图像特征;

    8、第一全连接层部分,以所述骨干网络部分的输出为输入,输出哈希编码的连续值;

    9、第二全连接层部分,以所述第一全连接层部分的输出为输入,输出符合数据集标签类别数。

    10、所述神经网络模型的训练过程如下:

    11、对训练数据集中的每个样本均进行主体内容的提取,并将每个样本中的非主体内容用黑色像素代替,得到第一训练图像;

    12、对所述第一训练图像进行图像增强操作,得到第二训练图像;

    13、将所述第一训练图像和第二训练图像输入至所述神经网络模型,得到每个训练图像的哈希编码的连续值;

    14、将得到的哈希编码的连续值使用第一损失函数做逼近,优化所述神经网络模型得到更小的第一损失函数值;将得到的哈希编码的连续值与图像的标签进行第二损失函数的损失估计,优化所述神经网络模型得到更小的第二损失函数值。

    15、所述图像增强操作包括图像的旋转操作和/或缩放操作。

    16、所述第一损失函数l1为:其中,bi1表示第一训练图像中第i个样本的哈希编码的连续值,bi2表示第二训练图像中第i个样本的哈希编码的连续值,n为训练数据集中的样本数量。

    17、所述第二损失函数l2为第一训练图像中第i个样本的哈希编码的连续值bi1与第一训练图像中第i个样本的哈希编码的连续值bi1的转置做内积后与所述第一训练图像中第i个样本的标签的二进制表示作差。

    18、所述提取所述待查询图像的主体内容以及所述对训练数据集中的每个样本均进行主体内容的提取时,均采用faster-rcnn目标检测模型进行主体内容的识别。

    19、本发明解决其技术问题所采用的技术方案是:提供一种基于深度哈希的特征提取检索装置,包括:

    20、接收模块,用于接收待查询图像;

    21、预处理模块,用于提取所述待查询图像的主体内容,并将所述待查询图像中的非主体内容用黑色像素代替,得到输入图像;

    22、检索模块,用于将所述输入图像输入训练好的神经网络模型,得到检索结果;其中,

    23、所述神经网络模型包括:

    24、骨干网络部分,用于提取输入图像的图像特征;

    25、第一全连接层部分,以所述骨干网络部分的输出为输入,输出哈希编码的连续值;

    26、第二全连接层部分,以所述第一全连接层部分的输出为输入,输出符合数据集标签类别数。

    27、所述神经网络模型的训练过程如下:

    28、对训练数据集中的每个样本均进行主体内容的提取,并将每个样本中的非主体内容用黑色像素代替,得到第一训练图像;

    29、对所述第一训练图像进行图像增强操作,得到第二训练图像;

    30、将所述第一训练图像和第二训练图像输入至所述神经网络模型,得到每个训练图像的哈希编码的连续值;

    31、将得到的哈希编码的连续值使用第一损失函数做逼近,优化所述神经网络模型得到更小的第一损失函数值;将得到的哈希编码的连续值与图像的标签进行第二损失函数的损失估计,优化所述神经网络模型得到更小的第二损失函数值。

    32、所述第一损失函数l1为:其中,bi1表示第一训练图像中第i个样本的哈希编码的连续值,bi2表示第二训练图像中第i个样本的哈希编码的连续值,n为训练数据集中的样本数量。

    33、所述第二损失函数l2为第一训练图像中第i个样本的哈希编码的连续值bi1与第一训练图像中第i个样本的哈希编码的连续值bi1的转置做内积后与所述第一训练图像中第i个样本的标签的二进制表示作差。

    34、有益效果

    35、由于采用了上述的技术方案,本发明与现有技术相比,具有以下的优点和积极效果:本发明对训练过程中输入神经网络模型的输入图像提前进行主体提取,使得输入图像保留了主体的标签,去除了无关项,以解决网络训练时间较长、收敛速度较慢的问题。另外,本发明使用多个损失开展神经网络模型的训练,每一个损失侧重关注点都有所不同,从而使得训练好的神经网络模型能够提取图像的高层特征,从而提升神经网络模型的map值。



    技术特征:

    1.一种基于深度哈希的特征提取检索方法,其特征在于,包括以下步骤:

    2.根据权利要求1所述的基于深度哈希的特征提取检索方法,其特征在于,所述神经网络模型的训练过程如下:

    3.根据权利要求2所述的基于深度哈希的特征提取检索方法,其特征在于,所述图像增强操作包括图像的旋转操作和/或缩放操作。

    4.根据权利要求2所述的基于深度哈希的特征提取检索方法,其特征在于,所述第一损失函数l1为:其中,bi1表示第一训练图像中第i个样本的哈希编码的连续值,bi2表示第二训练图像中第i个样本的哈希编码的连续值,n为训练数据集中的样本数量。

    5.根据权利要求2所述的基于深度哈希的特征提取检索方法,其特征在于,所述第二损失函数l2为第一训练图像中第i个样本的哈希编码的连续值bi1与第一训练图像中第i个样本的哈希编码的连续值bi1的转置做内积后与所述第一训练图像中第i个样本的标签的二进制表示作差。

    6.根据权利要求2所述的基于深度哈希的特征提取检索方法,其特征在于,所述提取所述待查询图像的主体内容以及所述对训练数据集中的每个样本均进行主体内容的提取时,均采用faster-rcnn目标检测模型进行主体内容的识别。

    7.一种基于深度哈希的特征提取检索装置,其特征在于,包括:

    8.根据权利要求7所述的基于深度哈希的特征提取检索装置,其特征在于,所述神经网络模型的训练过程如下:

    9.根据权利要求8所述的基于深度哈希的特征提取检索装置,其特征在于,所述第一损失函数l1为:其中,bi1表示第一训练图像中第i个样本的哈希编码的连续值,bi2表示第二训练图像中第i个样本的哈希编码的连续值,n为训练数据集中的样本数量。

    10.根据权利要求8所述的基于深度哈希的特征提取检索装置,其特征在于,所述第二损失函数l2为第一训练图像中第i个样本的哈希编码的连续值bi1与第一训练图像中第i个样本的哈希编码的连续值bi1的转置做内积后与所述第一训练图像中第i个样本的标签的二进制表示作差。


    技术总结
    本发明涉及一种基于深度哈希的特征提取检索方法和装置,其中,方法包括:接收待查询图像;提取所述待查询图像的主体内容,并将所述待查询图像中的非主体内容用黑色像素代替,得到输入图像;将所述输入图像输入训练好的神经网络模型,得到检索结果;其中,所述神经网络模型包括:骨干网络部分,用于提取输入图像的图像特征;第一全连接层部分,以所述骨干网络部分的输出为输入,输出哈希编码的连续值;第二全连接层部分,以所述第一全连接层部分的输出为输入,输出符合数据集标签类别数。本发明能够解决网络模型训练时间较长、收敛速度较慢的问题。

    技术研发人员:杨谋德,覃荣华,何光辉,李宝清
    受保护的技术使用者:中国科学院上海微系统与信息技术研究所
    技术研发日:
    技术公布日:2024/10/24
    转载请注明原文地址:https://symbian.8miu.com/read-43931.html

    最新回复(0)