本发明涉及人工智能,尤其涉及一种视频未来事件预测方法、装置、存储介质和程序产品。
背景技术:
1、随着计算机视觉和人工智能技术的飞速发展,视频内容分析和未来事件预测的需求日益增长。尤其是在安全监控、娱乐产业、自动驾驶汽车、医疗健康监测等领域,对于能够准确预测未来事件的技术存在迫切的需求。
2、然而,传统的方法仅基于规则或单一模态,例如仅基于图像或仅基于文本,在处理复杂的、多变的现实世界场景时存在局限性。这些方法往往无法充分理解视频内容的多样性和深层次的语义信息,进而限制了它们在未来事件预测方面的准确性和可靠性。
3、在这种情况下,亟需一种视频内容分析和未来事件预测的技术,能够克服在处理复杂的、多变的现实世界场景时的局限性,增强对复杂场景和细微变化的理解能力,使得该技术在安全监控、医疗诊断、交通管理等领域的应用更为有效;实现对复杂视频数据的深度分析和未来事件的准确预测,提高在未来事件预测方面的准确性和可靠性;基于当前数据预测长期趋势和潜在风险,为决策提供更全面的支持。例如,在智能交通系统中,预测并提前应对交通拥堵和事故;在公共安全领域,提前识别并响应潜在的安全威胁。
4、由此可见,通过分析视频中人物行为、情境语境、以及周围环境的变化,来预测视频后续可能的事件,具有重要的现实意义。
技术实现思路
1、针对上述现有技术存在的问题,本发明提出了一种视频未来事件预测方法、装置、存储介质和程序产品,其核心是结合视频中的视觉信息、音频内容、文本数据以及上下文信息,通过强大的大型模型进行综合分析,以实现对复杂视频数据的深度分析和未来事件的准确预测。
2、第一方面,本发明提供一种视频未来事件预测方法,包括以下步骤:
3、输入视频和视频内容描述;
4、将视频拆分为视频片段;
5、从视频片段中过滤出视频关键片段和视频关键帧;
6、采用因果注意力机制,从视频关键片段和视频关键帧中提取影响未来事件的信息;
7、构建思维推理链,引导模型;
8、通过语言生成模型解码,预测视频未来事件。
9、作为本发明的进一步改进,将视频拆分为视频片段时,采用注意力模块,融合每个视频片段内的特征。
10、作为本发明的进一步改进,所述视频片段为长度为m帧的重叠片段,视频片段的各相邻片段之间有m-1共享帧。
11、作为本发明的进一步改进,所述视频关键片段的获得方式,包括:
12、基于交叉注意力模块,结合视频片段和视频内容描述,计算注意力权重;
13、生成离散选择掩码;
14、重复捕获与视频内容描述相关的视频关键片段。
15、作为本发明的进一步改进,所述视频关键帧的获得方式,包括:
16、基于交叉注意力模块,结合视频关键片段和视频内容描述,计算注意力权重;
17、生成离散选择掩码;
18、重复捕获与视频内容描述相关的视频关键帧。
19、作为本发明的进一步改进,所述采用因果注意力机制,从视频关键片段和视频关键帧中提取影响未来事件的信息,包括:
20、提取整个视频的所有帧的视觉特征;
21、通过多头注意力机制,生成视频的所有帧的[cls]令牌,作为全局时间语义特征;
22、使用集合表示提取的[cls]令牌的帧索引;
23、将视频关键片段和视频关键帧分别与全局时间语义特征融合生成关键片段视觉特征和关键帧视觉特征;
24、融合关键片段视觉特征和关键帧视觉特征,得到视频特征表示;
25、使用可学习的查询嵌入通过具有因果掩码的自注意力层与视频特征表示交互;
26、通过交叉注意力层生成携带视觉信息的输出查询向量;
27、输出查询视觉表示;
28、提取影响未来事件的信息。
29、作为本发明的进一步改进,所述构建思维推理链包括:采用目标检测模型提取视频关键片段和视频关键帧中的对象位置信息,结合提示输入语言生成模型进行思维推理链构建;
30、所述思维推理链,包括:上下文分析、行动分析、逻辑过程和启发式预测;
31、所述上下文分析用于对视频中的上下文信息进行分析,获取视频内容与未来事件之间的关联;
32、所述行动分析用于分析视频中的动作,理解动作对未来事件可能方向的指示作用;
33、所述逻辑过程用于理解事件之间的因果关系,以更好地预测未来可能发生的事件;
34、所述启发式预测用于探索基于现有信息的未来事件的可能性。
35、作为本发明的进一步改进,所述通过语言生成模型解码,预测视频未来事件,包括:
36、创建包含令牌的输入序列,所述令牌包括:视觉令牌、语言令牌和用户提示令牌;
37、所述视觉令牌包含片段级和帧级的视觉信息;
38、所述语言令牌包括从视频内容描述中提取的思维推理链的语言信息;
39、所述用户提示令牌用于表达用户的需求和指令;
40、对输入序列进行线性变换;
41、将视觉信息和语言信息的模态表示进行对齐;
42、利用大型语言模型,将对齐的模态表示整合到指令中;
43、模型使用当前的参数和之前的输出预测下一个令牌的概率分布,逐步产生输出序列,预测视频未来事件。
44、第二方面,本发明提供一种计算机装置/设备/系统,包括存储器、处理器及存储在存储器上的计算机程序,所述处理器执行所述计算机程序以实现上述方法的步骤。
45、第三方面,本发明提供一种计算机可读存储介质,其上存储有计算机程序/指令,该计算机程序/指令被处理器执行时实现上述方法的步骤。
46、第四方面,本发明提供一种计算机程序产品,包括计算机程序/指令,该计算机程序/指令被处理器执行时实现上述方法的步骤。
47、与现有技术相比,本发明的有益效果在于:
48、本发明提出一种视频未来事件预测方法、装置、存储介质和程序产品,克服了在处理复杂的、多变的现实世界场景时的局限性,增强了对复杂场景和细微变化的理解能力,使得在安全监控、医疗诊断、交通管理等领域的应用更为有效;实现了对复杂视频数据的深度分析和未来事件的准确预测,提高了在未来事件预测方面的准确性和可靠性。
49、此外,本发明能够基于当前数据预测长期趋势和潜在风险,为决策提供更全面的支持。例如,在智能交通系统中,可以预测并提前应对交通拥堵和事故;在公共安全领域,能够提前识别并响应潜在的安全威胁。
50、总之,本发明能够为处理和理解复杂视频数据提供一种高效、智能且全面的解决方案。
1.一种视频未来事件预测方法,其特征在于,包括以下步骤:
2.根据权利要求1所述的视频未来事件预测方法,其特征在于,将视频拆分为视频片段时,采用注意力模块,融合每个视频片段内的特征。
3.根据权利要求1或2所述的视频未来事件预测方法,其特征在于,所述视频片段为长度为m帧的重叠片段,视频片段的各相邻片段之间有m-1共享帧。
4.根据权利要求1所述的视频未来事件预测方法,其特征在于,所述视频关键片段的获得方式,包括:
5.根据权利要求1所述的视频未来事件预测方法,其特征在于,所述视频关键帧的获得方式,包括:
6.根据权利要求1所述的视频未来事件预测方法,其特征在于,所述采用因果注意力机制,从视频关键片段和视频关键帧中提取影响未来事件的信息,包括:
7.根据权利要求1所述的视频未来事件预测方法,其特征在于,所述构建思维推理链包括:采用目标检测模型提取视频关键片段和视频关键帧中的对象位置信息,结合提示输入语言生成模型进行思维推理链构建;
8.根据权利要求1所述的视频未来事件预测方法,其特征在于,所述通过语言生成模型解码,预测视频未来事件,包括:
9.一种计算机装置/设备/系统,包括存储器、处理器及存储在存储器上的计算机程序,其特征在于,所述处理器执行所述计算机程序以实现权利要求1-8中的任一项所述方法的步骤。
10.一种计算机可读存储介质,其上存储有计算机程序/指令,其特征在于,该计算机程序/指令被处理器执行时实现权利要求1-8中的任一项所述方法的步骤。
11.一种计算机程序产品,包括计算机程序/指令,其特征在于,该计算机程序/指令被处理器执行时实现权利要求1-8中的任一项所述方法的步骤。
