一种视频理解方法、系统、电子设备和存储介质与流程

    技术2026-09-09  5


    所属的技术人员知道,本发明可以实现为系统、方法或计算机程序产品,因此,本公开可以具体实现为以下形式,即:可以是完全的硬件、也可以是完全的软件(包括固件、驻留软件、微代码等),还可以是硬件和软件结合的形式,本文一般称为“电路”、“模块”或“系统”。此外,在一些实施例中,本发明还可以实现为在一个或多个计算机可读介质中的计算机程序产品的形式,该计算机可读介质中包含计算机可读的程序代码。可以采用一个或多个计算机可读的介质的任意组合。计算机可读介质可以是计算机可读信号介质或者计算机可读存储介质。计算机可读存储介质例如可以是一一但不限于——电、磁、光、电磁、红外线、或半导体的系统、装置或器件,或者任意以上的组合。计算机可读存储介质的更具体的例子(非穷举的列表)包括:具有一个或多个导线的电连接、便携式计算机磁盘、硬盘、随机存取存储器(ram),只读存储器(rom)、可擦式可编程只读存储器(eprom或闪存)、光纤、便携式紧凑磁盘只读存储器(cd-rom)、光存储器件、磁存储器件、或者上述的任意合适的组合。在本技术中,计算机可读存储介质可以是任何包含或存储程序的有形介质,该程序可以被指令执行系统、装置或者器件使用或者与其结合使用。尽管上面已经示出和描述了本发明的实施例,可以理解的是,上述实施例是示例性的,不能理解为对本发明的限制,本领域的普通技术人员在本发明的范围内可以对上述实施例进行变化、修改、替换和变型。


    背景技术:

    1、视频理解大模型,是指通过输入一段视频,大模型能够以文字形式给出对视频的理解,并能够根据用户的问题,给出视频相关的回答。视频理解大模型的主要挑战是如何对输入视频进行有效的信息编码。即输入视频后,如何将整段视频转换为模型可以理解的信息。目前主流的视频理解大模型通常采用视频均匀抽帧或逐帧编码的方法来提取视频信息。具体地:

    2、1)如图2所示,视频均匀抽帧的方法是指:对输入视频进行均匀抽样,抽出固定的n帧;然后送入视觉编码器进行编码,最后通过投影层接入大语言模型。

    3、2)如图3所示,逐帧编码的方法则是先对视频每一帧图像进行编码,然后再利用一个模型对所有帧的编码信息进行压缩,最后通过投影层接入大语言模型。

    4、视频均匀抽帧的方法较为常用,该方法通常只均匀采样8帧,也就是不管输入视频有多长,只取8帧。当输入的视频很短且内容单一时,这种方法不会造成太多的信息丢失。但是如果输入视频很长或者视频内容密集,这种方法就会丢失大量信息。从而无法使大语言模型做到准确的视频理解。

    5、逐帧编码的方法需要对每一帧图像进行编码,且每一帧的编码特征都要进入信息压缩网络,其信息量要优于均匀采样的方法。即使视频很长或内容密集,也不会造成过多的信息丢失。但是该方法的缺点是,当输入视频很长时,处理速度会很慢,而且需要大量计算资源,有可能造成整个处理进程的异常。

    6、因此,亟需提供一种技术方案解决上述问题。


    技术实现思路

    1、为解决上述技术问题,本发明提供了一种视频理解方法、系统、电子设备和存储介质。

    2、第一方面,本发明提供一种视频理解方法,该方法的技术方案如下:

    3、按照预设抽帧间隔,对目标视频进行抽帧,得到多个目标视频帧并分别进行编码,得到多个初始视频帧编码特征;

    4、计算每两个时间相邻的初始视频帧编码特征之间的余弦相似度,并将余弦相似度不大于第一阈值的两个时间相邻的初始视频帧编码特征确定为目标视频帧编码特征;

    5、当目标视频帧编码特征的数量不小于第二阈值时,构建表征所有目标视频帧编码特征的初始时序编码特征并进行特征压缩,得到目标时序编码特征;

    6、对所述目标时序编码特征进行映射,得到映射编码特征,并将所述映射编码特征与所述目标视频对应的问题文本的token序列输入至训练好的大语言模型,得到所述问题文本对应的回答文本。

    7、本发明的一种视频理解方法的有益效果如下:

    8、本发明的方法能够有效提取视频的重要变化信息,避免了信息丢失,从而提升了大语言模型对于视频理解的准确率与效率。

    9、在上述方案的基础上,本发明的一种视频理解方法还可以做如下改进。

    10、在一种可选的方式中,还包括:

    11、当目标视频帧编码特征的数量小于所述第二阈值时,对大于所述第一阈值的余弦相似度进行升序排列,得到目标队列;

    12、将所述目标队列中的首个余弦相似度作为第三阈值,并在剩余的初始视频帧编码特征中,将余弦相似度不大于所述第三阈值的两个时间相邻的初始视频帧编码特征确定为目标视频帧编码特征,并判断目标视频帧编码特征的数量是否小于所述第二阈值;

    13、当目标视频帧编码特征的数量小于所述第二阈值时,依次遍历所述目标队列中的余弦相似度,直至目标视频帧编码特征的数量不小于所述第二阈值时,执行所述构建表征所有目标视频帧编码特征的初始时序编码特征并进行特征压缩的步骤。

    14、在一种可选的方式中,构建表征所有目标视频帧编码特征的初始时序编码特征并进行特征压缩,得到目标时序编码特征的步骤,包括:

    15、利用时空注意力模型,构建表征所有目标视频帧编码特征的初始时序编码特征,并利用所述时空注意力模型,对所述初始时序编码特征进行特征压缩,得到固定长度的所述目标时序编码特征。

    16、在一种可选的方式中,对所述目标时序编码特征进行映射,得到映射编码特征的步骤,包括:

    17、利用投影层,对所述目标时序编码特征进行映射,得到所述映射编码特征。

    18、在一种可选的方式中,所述大语言模型的训练过程为:

    19、获取每个训练视频的映射编码特征与训练问题文本的token序列,并将任一训练视频的映射编码特征与训练问题文本的token序列输入至所述大语言模型,得到该训练视频的训练问题文本对应的训练回答文本,并根据该训练视频的训练回答文本与真实回答文本之间的差异,得到该训练视频的损失值,直至得到每个训练视频的损失值;

    20、根据每个训练视频的损失值,对所述大语言模型进行参数优化,得到优化后的大语言模型,并将所述优化后的大语言模型作为所述大语言模型并返回执行将任一训练视频的映射编码特征与训练问题文本的token序列输入至所述大语言模型的步骤,直至满足迭代优化条件时,将所述优化后的大语言模型确定为所述训练好的大语言模型。

    21、第二方面,本发明提供一种视频理解系统,该系统的技术方案如下:

    22、包括:第一处理模块、计算模块、第二处理模块和运行模块;

    23、所述第一处理模块用于:按照预设抽帧间隔,对目标视频进行抽帧,得到多个目标视频帧并分别进行编码,得到多个初始视频帧编码特征;

    24、所述计算模块用于:计算每两个时间相邻的初始视频帧编码特征之间的余弦相似度,并将余弦相似度不大于第一阈值的两个时间相邻的初始视频帧编码特征确定为目标视频帧编码特征;

    25、所述第二处理模块用于:当目标视频帧编码特征的数量不小于第二阈值时,构建表征所有目标视频帧编码特征的初始时序编码特征并进行特征压缩,得到目标时序编码特征;

    26、所述运行模块用于:对所述目标时序编码特征进行映射,得到映射编码特征,并将所述映射编码特征与所述目标视频对应的问题文本的token序列输入至训练好的大语言模型,得到所述问题文本对应的回答文本。

    27、本发明的一种视频理解系统的有益效果如下:

    28、本发明的系统能够有效提取视频的重要变化信息,避免了信息丢失,从而提升了大语言模型对于视频理解的准确率与效率。

    29、在上述方案的基础上,本发明的一种视频理解系统还可以做如下改进。

    30、在一种可选的方式中,还包括:判断模块;所述判断模块用于:

    31、当目标视频帧编码特征的数量小于所述第二阈值时,对大于所述第一阈值的余弦相似度进行升序排列,得到目标队列;

    32、将所述目标队列中的首个余弦相似度作为第三阈值,并在剩余的初始视频帧编码特征中,将余弦相似度不大于所述第三阈值的两个时间相邻的初始视频帧编码特征确定为目标视频帧编码特征,并判断目标视频帧编码特征的数量是否小于所述第二阈值;

    33、当目标视频帧编码特征的数量小于所述第二阈值时,依次遍历所述目标队列中的余弦相似度,直至目标视频帧编码特征的数量不小于所述第二阈值时,调用所述第二处理模块。

    34、在一种可选的方式中,所述第二处理模块中的构建表征所有目标视频帧编码特征的初始时序编码特征并进行特征压缩,得到目标时序编码特征的步骤,包括:

    35、利用时空注意力模型,构建表征所有目标视频帧编码特征的初始时序编码特征,并利用所述时空注意力模型,对所述初始时序编码特征进行特征压缩,得到固定长度的所述目标时序编码特征。

    36、第三方面,本发明的一种电子设备的技术方案如下:

    37、包括存储器、处理器及存储在所述存储器上并在所述处理器上运行的程序,所述处理器执行所述程序时实现如本发明的视频理解方法的步骤。

    38、第四方面,本发明提供的一种计算机可读存储介质的技术方案如下:

    39、计算机可读存储介质中存储有指令,当计算机可读存储介质读取所述指令时,使所述计算机可读存储介质执行如本发明的视频理解方法的步骤。

    40、上述说明仅是本发明技术方案的概述,为了能够更清楚了解本发明的技术手段,而可依照说明书的内容予以实施,并且为了让本发明的上述和其它目的、特征和优点能够更明显易懂,以下特举本发明的具体实施方式。


    技术特征:

    1.一种视频理解方法,其特征在于,包括:

    2.根据权利要求1所述的视频理解方法,其特征在于,还包括:

    3.根据权利要求1所述的视频理解方法,其特征在于,构建表征所有目标视频帧编码特征的初始时序编码特征并进行特征压缩,得到目标时序编码特征的步骤,包括:

    4.根据权利要求1所述的视频理解方法,其特征在于,对所述目标时序编码特征进行映射,得到映射编码特征的步骤,包括:

    5.根据权利要求1至4任一项所述的视频理解方法,其特征在于,所述大语言模型的训练过程为:

    6.一种视频理解系统,其特征在于,包括:第一处理模块、计算模块、第二处理模块和运行模块;

    7.根据权利要求6所述的视频理解系统,其特征在于,还包括:判断模块;所述判断模块用于:

    8.根据权利要求6所述的视频理解系统,其特征在于,所述第二处理模块中的构建表征所有目标视频帧编码特征的初始时序编码特征并进行特征压缩,得到目标时序编码特征的步骤,包括:

    9.一种电子设备,其特征在于,所述电子设备包括处理器,所述处理器与存储器耦合,所述存储器中存储有至少一条计算机程序,所述至少一条计算机程序由所述处理器加载并执行,以使所述电子设备实现如权利要求1至5任一项所述的视频理解方法。

    10.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质中存储有至少一条计算机程序,所述至少一条计算机程序由处理器加载并执行,以使计算机可读存储介质实现如权利要求1至5任一项所述的视频理解方法。


    技术总结
    本发明涉及多模态大模型技术领域,具体公开一种视频理解方法、系统、电子设备和存储介质,包括:按照预设抽帧间隔对视频进行抽帧,得到多个视频帧并编码,得到多个初始编码特征;计算每两个时间相邻的初始编码特征的余弦相似度,并将余弦相似度不大于第一阈值的初始编码特征确定为目标编码特征;当目标编码特征的数量不小于第二阈值时,构建初始时序编码特征并压缩,得到目标时序编码特征;对目标时序编码特征进行映射,得到映射编码特征,并将映射编码特征与目标视频的问题文本token序列输入至训练好的大语言模型,得到回答文本。本发明能够有效提取视频的重要变化信息,避免了信息丢失,从而提升了大语言模型对于视频理解的准确率与效率。

    技术研发人员:吴柯维,何晓罡,朱小平,苑荧荧,延瑾瑜
    受保护的技术使用者:北京卓视智通科技有限责任公司
    技术研发日:
    技术公布日:2024/10/24
    转载请注明原文地址:https://symbian.8miu.com/read-48121.html

    最新回复(0)