文本检测模型训练方法、文本检测方法、装置及电子设备与流程

    技术2026-07-27  18


    本技术涉及文本检测,特别是涉及文本检测模型训练方法、文本检测方法、装置及电子设备。


    背景技术:

    1、文本检测在各个领域中的应用愈发广泛,例如,在图像搜索、身份认证和视觉导航等领域均有重要应用。文本检测是指ocr(optical character recognition,光学字符识别)过程中,在数字化图像或视频中定位识别文本区域的过程。

    2、在实际应用场景中,由于文本行的大小、字体、颜色、形状、方向和背景存在多样性,可能存在文本粘连的情况,会影响文本检测的精度。为了克服该问题,在利用基于语义分割的文本检测方法对图像进行文本检测时,一般需要对所检测到的文本框进行先内缩再外扩的处理,具体来说,利用vatti_clipping(裁剪)算法,按照固定的内缩经验参数对文本框进行内缩,得到内缩区域,再按照固定的外扩经验参数对内缩区域进行外扩,得到外扩区域。之后可以利用文本框、内缩区域以及外扩区域进行模型训练,得到文本检测模型。

    3、在理想条件下,内缩外扩前后的区域形状应该尽可能接近,然而目前的内缩外扩方法往往无法实现内缩外扩的一致性,例如,对于长文本区域,按照目前的内缩外扩方法其内缩外扩前后的区域形状存在较大差异,内缩框偏小使得该内缩框无法包括该长文本区域中的全部文本。这样,就会导致基于上述内缩外扩方法得到的内缩区域以及外扩区域训练得到的文本检测模型的文本定位的精确度不高。


    技术实现思路

    1、本技术实施例的目的在于提供文本检测模型训练方法、文本检测方法、装置及电子设备,以提高文本检测模型的文本定位的精确度。具体技术方案如下:

    2、第一方面,本技术实施例提供了一种文本检测模型训练方法,所述方法包括:

    3、针对每个训练图像中的各文本区域,按照第一预设搜索目标在该文本区域对应的内缩距离范围内,搜索该文本区域对应的内缩距离,其中,所述第一预设搜索目标为搜索得到的内缩距离使得外扩区域的面积与该文本区域的面积相同,所述外扩区域为按照该内缩距离对该文本区域进行内缩后再进行外扩得到的区域;

    4、基于每个训练图像中的各文本区域对应的内缩距离,对所述各文本区域进行内缩,得到每个训练图像的内缩图;

    5、对每个训练图像中的各文本区域进行外扩,得到每个文本区域对应的外扩区域;

    6、基于每个训练图像的内缩图以及该训练图像中各文本区域对应的外扩区域,生成该训练图像对应的分割图标签、阈值图标签和二值图标签;

    7、将每个训练图像输入待训练的文本检测模型,基于所述文本检测模型输出的预测概率图、预测阈值图以及预测二值图分别与所述分割图标签、所述阈值图标签以及所述二值图标签之间的差异,对所述文本检测模型进行训练,得到训练完成的文本检测模型。

    8、可选的,所述针对每个训练图像中的各文本区域,按照第一预设搜索目标在该文本区域对应的内缩距离范围内,搜索该文本区域对应的内缩距离的步骤,包括:

    9、针对每个训练图像中的各文本区域,以0为内缩距离范围的左边界,以目标值为内缩距离范围的右边界,确定内缩距离范围,其中,所述目标值基于该文本区域的周长确定;

    10、在所述内缩距离范围的左边界和右边界的差值大于预设精度阈值的情况下,在所述内缩距离范围内确定备选内缩距离;

    11、基于所述备选内缩距离更新所述内缩距离范围,并返回执行所述在所述内缩距离范围的左边界和右边界的差值大于预设精度阈值的情况下,在所述内缩距离范围内确定备选内缩距离的步骤,直至当前的内缩距离范围的左边界和右边界的差值不大于所述预设精度阈值,基于所述当前的内缩距离范围确定该文本区域对应的内缩距离。

    12、可选的,所述基于所述备选内缩距离更新所述内缩距离范围的步骤,包括:

    13、在利用所述备选内缩距离内缩失败,或基于所述备选内缩距离得到的备选外扩区域面积小于所述文本区域的面积的情况下,以所述备选内缩距离作为所述内缩距离范围的右边界,得到更新后的内缩距离范围,其中,所述备选外扩区域面积为基于所述备选内缩距离得到的外扩区域的面积;

    14、在所述备选外扩区域面积大于所述文本区域的面积的情况下,以所述备选内缩距离作为所述内缩距离范围的左边界,得到更新后的内缩距离范围。

    15、可选的,所述基于当前的内缩距离范围确定该文本区域对应的内缩距离的步骤,包括:

    16、在利用所述当前的内缩距离范围的右边界内缩失败,或第一面积差值的绝对值大于第二面积差值的绝对值的情况下,返回所述当前的内缩距离范围的左边界,作为该文本区域对应的内缩距离,其中,所述第一面积差值为基于所述右边界得到的外扩区域的面积与所述文本区域的面积的差值,所述第二面积差值为基于所述左边界得到的外扩区域的面积与所述文本区域的面积的差值;

    17、在所述第一面积差值的绝对值不大于所述第二面积差值的绝对值的情况下,返回所述当前的内缩距离范围的右边界,作为该文本区域对应的内缩距离。

    18、可选的,所述将每个训练图像输入待训练的文本检测模型,基于所述文本检测模型输出的预测概率图、预测阈值图以及预测二值图分别与所述分割图标签、所述阈值图标签以及所述二值图标签之间的差异,对所述文本检测模型进行训练,得到训练完成的文本检测模型的步骤,包括:

    19、将每个训练图像输入待训练的文本检测模型,得到预测概率图、预测阈值图以及预测二值图;

    20、基于所述分割图标签、所述阈值图标签、所述二值图标签、所述预测概率图、所述预测阈值图、所述预测二值图以及预设函数,计算该训练图像对应的损失值,其中,所述预设函数包括交叉熵损失函数、dice损失函数以及预先构建的交并比损失函数,所述交并比损失函数仅用于计算所述文本检测模型预测的训练图像中的文本区域形状与该训练图像对应的分割图标签所表征的文本区域形状之间的差异;

    21、根据所述损失值调整所述文本检测模型的参数,直到所述文本检测模型收敛,得到所述文本检测模型。

    22、可选的,所述基于所述分割图标签、所述阈值图标签、所述二值图标签、所述预测概率图、所述预测阈值图、所述预测二值图以及预设函数,计算该训练图像对应的损失值的步骤,包括:

    23、基于所述分割图标签、所述预测概率图以及所述交叉熵损失函数,计算所述训练图像对应的第一交叉熵损失值;

    24、基于所述二值图标签、所述预测二值图以及所述交叉熵损失函数,计算所述训练图像对应的第二交叉熵损失值;

    25、基于所述阈值图标签、所述预测阈值图以及所述dice损失函数,计算所述训练图像对应的dice损失值;

    26、基于所述分割图标签、所述预测概率图以及预先构建的交并比损失函数,计算所述训练图像对应的第一交并比损失值;和/或,基于所述二值图标签、所述预测二值图以及预先构建的交并比损失函数,计算所述训练图像对应的第二交并比损失值;

    27、计算所述第一交叉熵损失值、所述第二交叉熵损失值、所述dice损失值、所述第一交并比损失值,和/或,所述第二交并比损失值的和值,得到所述训练图像对应的损失值。

    28、可选的,所述基于所述分割图标签、所述预测概率图以及预先构建的交并比损失函数,计算所述训练图像对应的第一交并比损失值;和/或,基于所述二值图标签、所述预测二值图以及预先构建的交并比损失函数,计算所述训练图像对应的第二交并比损失值的步骤,包括:

    29、按照以下公式计算第一交并比损失值和/或第二交并比损失值:

    30、;

    31、其中,为交并比损失值;为所述文本检测模型输出的预测图中的像素点,为所述预测图对应的标签中的像素点,为预测图的长度,为预测图的宽度,在为所述预测概率图中的像素点的情况下,为所述分割图标签中的像素点,在为所述预测二值图中的像素点的情况下,为所述二值图标签中的像素点;为所属区域的权重,在所属区域为非文本区域的情况下,,在所属区域为文本区域的情况下,,为所述像素点所属文本区域的面积。

    32、第二方面,本技术实施例提供了一种文本检测方法,所述方法包括:

    33、获取待检测图像;

    34、将所述待检测图像输入预先训练的文本检测模型,获取所述文本检测模型输出的待检测图像的二值图,其中,所述文本检测模型为通过第一方面任一项所述方法训练得到的;

    35、确定所述二值图中的连通区域,得到所述待检测图像中文本所在的文本预测框,并对所述文本预测框进行外扩,得到所述待检测图像中的文本所在区域。

    36、可选的,所述方法还包括:

    37、按照第二预设搜索目标,在所述文本所在区域的各边缘点中,搜索该文本所在区域对应的四个目标点,其中,所述第二预设搜索目标为搜索得到的四个目标点所组成的四边形与所述文本所在区域的重合面积最大;

    38、将所述四个目标点组成的四边形,确定为所述待检测图像中的文本所在区域。

    39、可选的,所述按照第二预设搜索目标,在所述文本所在区域的各边缘点中,搜索该文本所在区域对应的四个目标点的步骤,包括:

    40、在所述文本所在区域的各边缘点中,选取四个备选点;

    41、计算所述四个备选点组成的四边形的分值,其中,所述分值基于所述四边形的面积和/或边长确定;

    42、依次遍历各备选点,在遍历到每个备选点时,将该备选点对应的搜索范围内的目标点,更新为该备选点,其中,所述目标点为:与除该备选点外的其他三个备选点所构成的四边形的得分最高且高于所述分值的边缘点,所述备选点的搜索范围包括该备选点的前一个备选点与该备选点的后一个备选点之间的各边缘点;

    43、在遍历完成后,将当前的四个备选点作为所述文本所在区域对应的四个目标点。

    44、可选的,所述计算所述四个备选点组成的四边形的分值的步骤,包括:

    45、按照以下公式计算分值:

    46、;

    47、其中,为所述分值,为所述四个备选点组成的四边形的面积,为所述四个备选点组成的四边形的周长,为所述四个备选点组成的四边形的对角线的总长度。

    48、可选的,所述方法还包括:

    49、以所述文本所在区域的两条中线中长度较大的中线作为待构建的旋转矩形的目标中线,构建面积与所述文本所在区域的面积相同的旋转矩形,作为所述待检测图像中的文本所在区域。

    50、可选的,所述以所述文本所在区域的两条中线中长度较大的中线作为待构建的旋转矩形的目标中线,构建面积与所述文本所在区域的面积相同的旋转矩形的步骤,包括:

    51、将所述文本所在区域的两条中线中长度较大的中线的两个端点,分别作为待构建的旋转矩形的两条短边的中点;

    52、将所述文本所在区域的面积和所述文本所在区域的两条中线中长度较大的中线的长度的比值,作为所述待构建的旋转矩形的两条短边的长度;

    53、以所述文本所在区域的两条中线中长度较大的中线作为待构建的旋转矩形的目标中线,按照所述短边的长度以及所述两条短边的中点,确定所述旋转矩形的四个顶点,以使所述旋转矩形的两条短边垂直于所述目标中线;

    54、将所述四个顶点组成的四边形,作为所述文本所在区域对应的旋转矩形。

    55、可选的,所述以所述文本所在区域的两条中线中长度较大的中线作为待构建的旋转矩形的目标中线,按照所述短边的长度以及所述两条短边的中点,确定所述旋转矩形的四个顶点的步骤,包括:

    56、将与所述目标中线的中线向量垂直的方向向量,作为所述短边的方向向量,其中,所述中线向量的方向为所述目标中线的延伸方向中的一个;

    57、基于所述方向向量与所述短边的长度,得到目标向量,其中,所述目标向量的方向与所述方向向量相同,且所述目标向量的长度为所述短边的长度的一半;

    58、分别计算每条短边的中点与所述目标向量的和值,得到所述旋转矩形的两个顶点;

    59、分别计算每条短边的中点与所述目标向量的差值,得到所述旋转矩形的另外两个顶点。

    60、第三方面,本技术实施例提供了一种文本检测模型训练装置,所述装置包括:

    61、第一搜索模块,用于针对每个训练图像中的各文本区域,按照第一预设搜索目标在该文本区域对应的内缩距离范围内,搜索该文本区域对应的内缩距离,其中,所述第一预设搜索目标为搜索得到的内缩距离使得外扩区域的面积与该文本区域的面积相同,所述外扩区域为按照该内缩距离对该文本区域进行内缩后再进行外扩得到的区域;

    62、内缩模块,用于基于每个训练图像中的各文本区域对应的内缩距离,对所述各文本区域进行内缩,得到每个训练图像的内缩图;

    63、外扩模块,用于对每个训练图像中的各文本区域进行外扩,得到每个文本区域对应的外扩区域;

    64、标签生成模块,用于基于每个训练图像的内缩图以及该训练图像中各文本区域对应的外扩区域,生成该训练图像对应的分割图标签、阈值图标签和二值图标签;

    65、训练模块,用于将每个训练图像输入待训练的文本检测模型,基于所述文本检测模型输出的预测概率图、预测阈值图以及预测二值图分别与所述分割图标签、所述阈值图标签以及所述二值图标签之间的差异,对所述文本检测模型进行训练,得到训练完成的文本检测模型。

    66、第四方面,本技术实施例提供了一种文本检测模型,所述模型包括:

    67、图像获取模块,用于获取待检测图像;

    68、二值图获取模块,用于将所述待检测图像输入预先训练的文本检测模型,获取所述文本检测模型输出的待检测图像的二值图,其中,所述文本检测模型为通过第一方面任一项所述方法训练得到的;

    69、区域确定模块,用于确定所述二值图中的连通区域,得到所述待检测图像中文本所在的文本预测框,并对所述文本预测框进行外扩,得到所述待检测图像中的文本所在区域。

    70、第五方面,本技术实施例提供了一种电子设备,包括:

    71、存储器,用于存放计算机程序;

    72、处理器,用于执行存储器上所存放的程序时,实现第一方面或第二方面任一所述的方法。

    73、第六方面,本技术实施例提供了一种计算机可读存储介质,所述计算机可读存储介质内存储有计算机程序,所述计算机程序被处理器执行时实现第一方面或第二方面任一所述的方法。

    74、第七方面,本技术实施例还提供了一种包含指令的计算机程序产品,当其在计算机上运行时,使得计算机执行上述第一方面或第二方面任一所述的方法。

    75、本技术实施例有益效果:

    76、本技术实施例提供的文本检测模型训练方法,电子设备可以针对每个训练图像中的各文本区域,按照第一预设搜索目标在该文本区域对应的内缩距离范围内,搜索该文本区域对应的内缩距离,其中,第一预设搜索目标为搜索得到的内缩距离使得外扩区域的面积与该文本区域的面积相同,外扩区域为按照该内缩距离对该文本区域进行内缩后再进行外扩得到的区域;基于每个训练图像中的各文本区域对应的内缩距离,对各文本区域进行内缩,得到每个训练图像的内缩图;对每个训练图像中的各文本区域进行外扩,得到每个文本区域对应的外扩区域;基于每个训练图像的内缩图以及该训练图像中各文本区域对应的外扩区域,生成该训练图像对应的分割图标签、阈值图标签和二值图标签;将每个训练图像输入待训练的文本检测模型,基于文本检测模型输出的预测概率图、预测阈值图以及预测二值图分别与分割图标签、阈值图标签以及二值图标签之间的差异,对文本检测模型进行训练,得到训练完成的文本检测模型。

    77、由于各文本区域对应的内缩距离是在文本区域对应的内缩距离范围内搜索得到的,使得该文本区域先内缩再外扩后得到的外扩区域的面积与该文本区域的面积相同的内缩距离,这样,相比于按照固定的内缩经验参数进行内缩外扩的方式,针对各类文本区域,利用该文本区域对应的内缩距离对该文本区域进行内缩外扩均可以保持内缩外扩前后区域面积的一致性。从而,既可以避免文本区域之间的粘连又可以避免文本信息的丢失,提高了文本检测结果的准确性。并且利用根据各文本区域对应的内缩距离所得到的各文本区域的内缩区域,计算训练图像对应的分割图标签、阈值图标签和二值图标签,可以提高训练标签的准确性,进而利用各训练图像以及各训练图像对应的标签训练文本检测模型,可以提高训练得到的文本检测模型的文本定位精确度。当然,实施本技术的任一产品或方法并不一定需要同时达到以上所述的所有优点。


    技术特征:

    1.一种文本检测模型训练方法,其特征在于,所述方法包括:

    2.根据权利要求1所述的方法,其特征在于,所述针对每个训练图像中的各文本区域,按照第一预设搜索目标在该文本区域对应的内缩距离范围内,搜索该文本区域对应的内缩距离的步骤,包括:

    3.根据权利要求2所述的方法,其特征在于,所述基于所述备选内缩距离更新所述内缩距离范围的步骤,包括:

    4.根据权利要求3所述的方法,其特征在于,所述基于当前的内缩距离范围确定该文本区域对应的内缩距离的步骤,包括:

    5.根据权利要求1-4任一项所述的方法,其特征在于,所述将每个训练图像输入待训练的文本检测模型,基于所述文本检测模型输出的预测概率图、预测阈值图以及预测二值图分别与所述分割图标签、所述阈值图标签以及所述二值图标签之间的差异,对所述文本检测模型进行训练,得到训练完成的文本检测模型的步骤,包括:

    6.根据权利要求5所述的方法,其特征在于,所述基于所述分割图标签、所述阈值图标签、所述二值图标签、所述预测概率图、所述预测阈值图、所述预测二值图以及预设函数,计算该训练图像对应的损失值的步骤,包括:

    7.根据权利要求6所述的方法,其特征在于,所述基于所述分割图标签、所述预测概率图以及预先构建的交并比损失函数,计算所述训练图像对应的第一交并比损失值;和/或,基于所述二值图标签、所述预测二值图以及预先构建的交并比损失函数,计算所述训练图像对应的第二交并比损失值的步骤,包括:

    8.一种文本检测方法,其特征在于,所述方法包括:

    9.根据权利要求8所述的方法,其特征在于,所述方法还包括:

    10.根据权利要求9所述的方法,其特征在于,所述按照第二预设搜索目标,在所述文本所在区域的各边缘点中,搜索该文本所在区域对应的四个目标点的步骤,包括:

    11.根据权利要求10所述的方法,其特征在于,所述计算所述四个备选点组成的四边形的分值的步骤,包括:

    12.根据权利要求8-11任一项所述的方法,其特征在于,所述方法还包括:

    13.根据权利要求12所述的方法,其特征在于,所述以所述文本所在区域的两条中线中长度较大的中线作为待构建的旋转矩形的目标中线,构建面积与所述文本所在区域的面积相同的旋转矩形的步骤,包括:

    14.根据权利要求13所述的方法,其特征在于,所述以所述文本所在区域的两条中线中长度较大的中线作为待构建的旋转矩形的目标中线,按照所述短边的长度以及所述两条短边的中点,确定所述旋转矩形的四个顶点的步骤,包括:

    15.一种文本检测模型训练装置,其特征在于,所述装置包括:

    16.一种文本检测模型,其特征在于,所述模型包括:

    17.一种电子设备,其特征在于,包括:

    18.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质内存储有计算机程序,所述计算机程序被处理器执行时实现权利要求1-7任一或8-14任一所述的方法。


    技术总结
    本申请实施例提供了文本检测模型训练方法、文本检测方法、装置及电子设备。文本检测模型训练方法包括:针对每个训练图像中的各文本区域,按照预设搜索目标在该文本区域对应的内缩距离范围内,搜索该文本区域对应的内缩距离;基于训练图像中的各文本区域对应的内缩距离对各文本区域进行内缩,得到训练图像的内缩图;对各文本区域进行外扩,得到各文本区域对应的外扩区域;生成各训练图像的分割图标签、阈值图标签和二值图标签;将训练图像输入待训练的文本检测模型,基于模型输出的预测概率图、预测阈值图以及预测二值图分别与分割图标签、阈值图标签以及二值图标签之间的差异进行训练,得到文本检测模型。从而提高文本检测模型的文本定位精确度。

    技术研发人员:顾东豪
    受保护的技术使用者:杭州海康威视数字技术股份有限公司
    技术研发日:
    技术公布日:2024/10/24
    转载请注明原文地址:https://symbian.8miu.com/read-45971.html

    最新回复(0)