本申请涉及计算机视觉,尤其涉及一种视觉导航方法、装置、设备及存储介质。
背景技术:
1、视觉导航任务是引导智能体找到目标对象,而视觉感知是视觉导航任务的重点之一,智能体通过视觉感知获取环境信息,并基于获取的环境信息执行下一步动作。
2、视觉感知信息是否准确直接影响智能体动作选择的好坏,为此,主流的视觉导航方法充分利用环境信息,将多模态数据(多源数据)融合后预测智能体的动作,如将智能体观测到的环境图像信息、人机对话语音识别文本信息、目标检测位置信息和环境空间结构知识图谱信息等进行融合,得到融合后的环境信息,进而基于融合后的环境信息预测智能体的下一步动作。
3、然而,由于实际中多模态数据之间的模态尺度差异较大,而现有的多模态数据融合技术往往会忽略模态尺度较小的有用信息,造成模态坍缩现象,无法达到充分利用环境信息的目的,从而难以保证智能体能够准确地定位到目标对象。
技术实现思路
1、基于上述技术问题,本申请实施例提供一种视觉导航方法、装置、设备及存储介质,能够减少模态坍缩的情况,实现对环境信息的充分利用,提高智能体定位目标对象的准确性。
2、本申请实施例的技术方案是这样实现的:
3、第一方面,本申请实施例提供一种视觉导航方法,应用于智能体,所述方法包括:
4、获取当前时刻的第一观测帧;
5、基于所述第一观测帧,确定特征关系图,所述特征关系图中包括节点特征和边特征,所述节点特征是基于所述第一观测帧的全局图像特征和第一局部检测特征得到的,所述边特征是基于所述第一观测帧中的各目标对象之间的位置关系确定的;
6、基于所述特征关系图,对所述智能体进行动作预测,得到用于引导所述智能体运动的下一时刻的执行动作。
7、根据本申请实施例提供的一种视觉导航方法,所述基于所述第一观测帧,确定特征关系图,包括:
8、获取所述第一观测帧的全局图像特征和所述第一观测帧的第一局部检测特征,所述第一局部检测特征中包括各所述目标对象分别对应的第二局部检测特征;
9、基于所述全局图像特征和各所述目标对象分别对应的第二局部检测特征,确定与各所述目标对象分别对应的节点特征;
10、基于所述第一观测帧中的各所述目标对象之间的位置关系,确定至少两个所述节点特征之间的边特征;
11、基于所述节点特征和所述边特征,确定所述特征关系图。
12、根据本申请实施例提供的一种视觉导航方法,所述第一观测帧包括彩色图像和深度图像;
13、所述获取所述第一观测帧的全局图像特征和所述第一观测帧的第一局部检测特征,包括:
14、分别对所述彩色图像和所述深度图像进行特征提取,获得所述彩色图像对应的第一图像特征和所述深度图像对应的第二图像特征;
15、将所述第一图像特征和所述第二图像特征进行拼接,获得所述全局图像特征;
16、利用目标检测器,对所述彩色图像进行目标检测,获得所述第一局部检测特征。
17、根据本申请实施例提供的一种视觉导航方法,所述方法还包括:
18、获取所述下一时刻的第二观测帧;
19、对所述第二观测帧进行目标检测,获得所述第二观测帧的第三局部检测特征;
20、基于所述第三局部检测特征,利用图注意力网络对所述特征关系图进行更新;
21、基于更新后的所述特征关系图,对所述智能体进行动作预测,得到用于引导所述智能体运动的下下一时刻的执行动作。
22、根据本申请实施例提供的一种视觉导航方法,所述基于所述特征关系图,对所述智能体进行动作预测,得到用于引导所述智能体运动的下一时刻的执行动作,包括:
23、将所述特征关系图中的所述节点特征和所述边特征作为所述当前时刻的状态特征;
24、基于所述当前时刻的状态特征,利用长短期记忆网络预测所述下一时刻的状态特征;
25、基于所述下一时刻的状态特征,对所述智能体进行动作预测,得到用于引导所述智能体运动的下一时刻的执行动作。
26、根据本申请实施例提供的一种视觉导航方法,所述长短期记忆网络包括多个隐藏层;
27、所述基于所述当前时刻的状态特征,利用长短期记忆网络预测所述下一时刻的状态特征,包括:
28、将所述当前时刻的状态特征输入所述长短期记忆网络,获得所述长短期记忆网络中的各所述隐藏层分别预测得到的所述下一时刻的状态特征。
29、根据本申请实施例提供的一种视觉导航方法,所述基于所述下一时刻的状态特征,对所述智能体进行动作预测,得到用于引导所述智能体运动的下一时刻的执行动作,包括:
30、基于各所述隐藏层分别预测得到的所述下一时刻的状态特征,确定各所述下一时刻的状态特征分别对应的预测动作;
31、基于各所述下一时刻的状态特征分别对应的预测动作,利用异步优势演员评论家算法对所述智能体进行动作预测,得到用于引导所述智能体运动的下一时刻的执行动作。
32、第二方面,本申请实施例提供一种视觉导航装置,应用于智能体,所述装置包括:
33、获取模块,用于获取当前时刻的第一观测帧;
34、确定模块,用于基于所述第一观测帧,确定特征关系图,所述特征关系图中包括节点特征和边特征,所述节点特征是基于所述第一观测帧的全局图像特征和第一局部检测特征得到的,所述边特征是基于所述第一观测帧中的各目标对象之间的位置关系确定的;
35、预测模块,用于基于所述特征关系图,对所述智能体进行动作预测,得到用于引导所述智能体运动的下一时刻的执行动作。
36、第三方面,本申请实施例提供一种电子设备,包括存储器和处理器,所述存储器用于存储可执行数据指令;所述处理器用于执行所述存储器中存储的可执行指令时,实现如第一方面所述的视觉导航方法。
37、第四方面,本申请实施例提供一种计算机可读存储介质,所述计算机可读存储介质中存储有计算机程序,当所述计算机程序被处理器运行时,实现如第一方面所述的视觉导航方法。
38、本申请实施例提供的视觉导航方法、装置、设备及存储介质,通过基于当前时刻的第一观测帧,确定特征关系图,且该特征关系图中的节点特征是基于第一观测帧的全局图像特征和第一局部检测特征得到的,而且全局图像特征是对第一观测帧进行特征提取得到的,第一局部检测特征是对第一观测帧进行目标检测得到的,实现了将不同模态的数据归纳为特征关系图的节点表示,统一了各模态数据之间的维度,可以减少模态坍缩的情况,而且,特征关系图中的边特征是基于第一观测帧中的各目标对象之间的位置关系确定的,实现了对环境信息的充分利用;然后基于包括有节点特征和边特征的特征关系图,可以对智能体进行精准地动作预测,提高智能体定位目标对象的准确性。
1.一种视觉导航方法,其特征在于,应用于智能体,所述方法包括:
2.根据权利要求1所述的视觉导航方法,其特征在于,所述基于所述第一观测帧,确定特征关系图,包括:
3.根据权利要求2所述的视觉导航方法,其特征在于,所述第一观测帧包括彩色图像和深度图像;
4.根据权利要求1所述的视觉导航方法,其特征在于,所述方法还包括:
5.根据权利要求1所述的视觉导航方法,其特征在于,所述基于所述特征关系图,对所述智能体进行动作预测,得到用于引导所述智能体运动的下一时刻的执行动作,包括:
6.根据权利要求5所述的视觉导航方法,其特征在于,所述长短期记忆网络包括多个隐藏层;
7.根据权利要求6所述的视觉导航方法,其特征在于,所述基于所述下一时刻的状态特征,对所述智能体进行动作预测,得到用于引导所述智能体运动的下一时刻的执行动作,包括:
8.一种视觉导航装置,其特征在于,应用于智能体,所述装置包括:
9.一种电子设备,其特征在于,包括:
10.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质中存储有计算机程序,当所述计算机程序被处理器运行时,实现权利要求1至7任一项所述的视觉导航方法。
