一种多源异构传感信息融合的目标检测与跟踪网络模型及方法

    技术2026-09-09  5


    本发明属于智能自动驾驶汽车环境感知,具体地指一种多源异构传感信息融合的目标检测与跟踪网络模型及方法。


    背景技术:

    1、智能自动驾驶汽车主要由环境感知、路径规划和决策控制三大系统组成。智能自动驾驶汽车通过多种车载环境感知传感器提供了原始相机图像、雷达点云等形式的海量数据,环境感知系统需要从海量原始数据中准确且可靠地提取出对驾驶所需要的有用信息,是无人驾驶汽车系统的基础,保证着车辆安全且可靠的行驶。迄今为止,大多数现有的三维目标检测与跟踪方法都是基于主流数据集提供的普通驾驶场景,对实际复杂驾驶场景(强光、黑夜、雨天、雾天、遮挡等)的研究被忽视,确保智能汽车能在各种环境下鲁棒且准确的进行目标检测与跟踪对于智能汽车行车安全至关重要,这也是制约自动驾驶汽车长期以来无法达到4级或更高自动驾驶水平的瓶颈之一。

    2、为了应对复杂驾驶场景,车载环境感知系统的发展已趋向于多源异构传感信息融合的理念,将视觉相机、激光雷达以及毫米波雷达三种环境感知传感器的优势相互结合,对环境进行全方位、立体化的高精度感知,有助于赋予汽车更高级别的自主驾驶能力。多源异构传感信息融合这种取长补短的方案能够弥补单一传感器设备无法克服的局限性,如视觉相机在黑夜或强光条件下丧失检测能力,无法感知深度信息;激光雷达在恶劣天气条件下(如雨、雪、雾天气)的性能下降;而毫米波雷达的分辨率和精确度较低。同时,多传感器融合也将提高感知系统的冗余性和鲁棒性,对于异常情况下的处理有更加出色的表现。对于未来的智能汽车来说,只有实现多模态的环境感知与稳定的信息处理,才能满足其在各种复杂环境下的安全驾驶要求。

    3、基于多传感器融合的三维目标检测:鸟瞰视角(bird's eye view,简称为bev),而不同的方法之间的主要区别在于获取图像bev的方法与多模态融合的方式。transfusion在高度方向上压缩图像特征以获取图像bev特征,并采用两层transformer解码器进行图像与激光点云的自适应融合,多视图特征渲染到bev特征空间中,计算成本与三维空间的范围成正比,因此这种方法不可避免地无法扩展到大规模场景。bevfusion则是直接将图像bev特征与激光雷达点云的bev特征进行拼接,但是,这种方式直接融合的高维异构特征可能会相互干扰,这可能使网络难以理解;openoccupancy的方法采用占据概率来描述3d场景,可以更全面的描述真实的驾驶场景并有效的解决长尾问题,但是算力消耗巨大难以实车落地;相比之下,交叉注意力在处理多模态特征时表现出更多优势,因此,该方法在最近的一些研究(例如cmt、mixedfusion、uniad、reasonnet和interfuser)中被广泛使用。然而,这些方法将交叉注意力的可学习query初始化为随机生成的参数,未能利用多模态特征中蕴含的先验信息。这也可能导致同一关键对象在多个模态之间的不对齐,最终导致模型学习的收敛速度较慢且不够优化。

    4、目前,多目标跟踪任务(multi-object tracking,mot)中有两种主要的跟踪框架:基于检测的跟踪框架和联合检测跟踪框架。基于检测的跟踪框架其主要思想是依此执行状态预测、数据关联和轨迹管理任务,进而输出跟踪结果。王海等人提出的centerpoint-enhance采用了基于卡尔曼滤波和神经网络的状态预测模块、在数据关联中采用了二阶段的数据关联策略,进而提升跟踪精度;camo-mot通过运用级联匹配技术,设计了一种空间动态信息的关联系统,在其架构的一级匹配阶段,空间运动信息被广泛应用于大多数对象的相关性识别。然后,在第二级匹配阶段,调用图像外观特征,对剩余对象展开关联。这种匹配技术能够在多维度上建立和维护对象的关联,从而实现跨越时间和空间的行为分析,这种特性在处理复杂场景中可能出现的各种情况时尤为关键;eagermot则是采用一种二阶段关联算法,在这个数据关联框架中,第一阶段便是标准的匈牙利数据关联,它针对的是三维边界框的识别和追踪。而联合检测跟踪框架将检测和跟踪结合到一个可端到端训练的网络中,在motiontrack算法中,则是采用了transformer架构进行数据关联,在完成多目标跟踪任务的同时也可以输出检测结果。

    5、尽管现有的三维目标检测与跟踪算法已经取得了一定的进展,但是,在复杂环境下的目标检测与跟踪的效果却不尽如人意,经过大量的研究讨论,目前的基于多源异构传感信息融合的目标检测与跟踪的方法存在着以下几个不足:

    6、(1)现有方法都是基于主流数据集提供的普通驾驶场景进行训练与测试,对实际驾驶过程中常会遇到的复杂环境的研究却被忽视。由于复杂交通场景下机非混合、恶劣天气的随机不定性以及多源传感器数据融合的不确定性等影响因素,导致现有方法难以在复杂环境中满足高精度、高可信性、高安全性等多方面要求。

    7、(2)毫米波雷达点云穿透能力强,在雨雾天气下的性能几乎不受影响,其优势是其他传感器无法比拟的。但是,在当前的多模态融合框架中,毫米波雷达由于其生成的雷达点云数据的分辨率低,误检严重,简单的将毫米波雷达点云引入数据融合,不仅不能提高算法的鲁棒性,反而降低了融合数据的置信度。

    8、(3)用于相机视图转化的lss算法虽然十分成熟,但其透视成像原理不可避免地造成深度信息的缺失,进而影响图像支路检测精度与最终的融合检测结果。

    9、(4)经典算法anchor-detr与petr等利用随机生成的参数对可学习的查询进行初始化,随后对象查询通过多层transformer解码器层进行优化。但是,如果初始化的对象查询带有多模态密集的先验信息,可以降低模型在优化过程中的难度同时提高整体性能。


    技术实现思路

    1、为了解决上述问题,提高智能汽车在复杂交通场景下感知的精度、可信性以及行车安全性,本发明提出了一种面向复杂交通场景下的高鲁棒性多源异构传感信息融合的目标检测与跟踪网络模型:robustfusion。该网络模型包括多模态特征提取与bev特征生成模块、激光雷达指导的相机视图转化模块、带有先验信息的查询初始化模块、基于跨模态注意力机制的特征融合模块、基于lstm与transformer的数据关联匹配模块。本发明的实施包含以下步骤:

    2、s1:设计多模态特征提取与bev特征生成模块

    3、本发明设计出一种名为robustfusion的网络模型,该网络模型采用一种改进的特征提取框架,该框架基于bevfusion多分支架构,有效整合多模态传感器数据,实现高级的特征表示。该网络模型的特征提取网络具有一定的独立性但是又相互关联,特征提取网络分别对相机图像、激光雷达以及毫米波雷达点云数据进行处理。对于激光雷达点云处理支路和毫米波雷达点云处理支路,本发明直接提取bev特征;而对于相机图像处理支路,为了更精确的获得相机图像的bev特征,构建基于精确空间信息作为指导的相机视图转化模块;此外,毫米波雷达由于其生成的雷达点云数据的分辨率低,误检严重,往往较少被采用,但是毫米波雷达穿透能力强,在雨雾天气下的性能几乎不受影响,在雨雾天气中的优势是其他传感器无法比拟的,为了充分利用毫米波雷达在复杂环境下的优势,本发明在毫米波雷达点云的处理支路中,引入了基于邻域注意力机制的骨干网络,强化了模型对关键信息的捕捉能力,提升毫米波雷达点云数据对环境更为精细和准确的理解。

    4、s2:设计激光雷达指导的相机视图转化模块

    5、用于相机视图转化的lss算法,其透视成像原理不可避免地造成深度信息的缺失,进而影响图像支路检测精度与最终的融合检测结果。为了更换好的利用激光雷达点云提供的精确空间信息,构建基于激光雷达指导的相机视图转化模块,进而通过激光雷达作为先验引导,使得在bev空间中获得精确的图像表示。该模块将上一帧相机bev特征和当前帧激光雷达的bev特征融合为查询(query)特征,图像特征充当注意力机制中的键(key)和值(value),融合后的查询特征与图像特征执行可变形交叉注意力以更新相机bev特征。

    6、s3:构建带有先验信息的查询初始化模块

    7、经典算法anchor-detr与petr等利用随机生成的参数对可学习的查询进行初始化,随后对象查询通过多层transformer解码器层进行优化。如果初始化的对象查询带有多模态密集的先验信息,可以降低模型在优化过程中的难度同时提高整体性能。为此,构建带有先验信息的查询初始化方案,充分利用多模态数据特征;本发明还采用基于时序信息的查询增强模块,利用跟踪任务增强检测精度。本发明构建带有先验信息的查询初始化方案具体为:三模态下的bev特征将会用于对象查询的初始化操作,将三模态下的bev特征同时输入到占用预测网络中生成热图,进而经过一个前馈网络将其编码生成位置嵌入和内容嵌入。此外,本发明还引入了一种基于时序信息的查询增强模块,使得模型能够利用跟踪任务来提高检测精度。步骤s5将会详细阐述基于时序信息的查询增强模块。

    8、s4:设计基于跨模态注意力机制的特征融合模块

    9、本发明将可形变注意力扩展到多模态领域,设计出基于跨模态的可形变的注意力机制,步骤s3生成的带有先验信息的查询将会与多模态融合特征进行交互,通过采用可形变的注意力机制进行跨模态的特征融合,可以实现对来自各个模态信息的采样特征进行自适应加权和求和来融合多模态特征。

    10、s5:设计基于lstm与transformer的数据关联匹配

    11、本发明提出了一种基于lstm(long short-term memory)与transformer的数据关联匹配模块,该模块包含了三个关键步骤:基于lstm的查询特征更新、目标特征更新以及查询与目标特征之间的关联。

    12、本发明还设计了基于时序信息的查询增强模块,旨在构建并增强先前帧检测到的对象特征,增强后的结果将会应用于步骤s3,利用跟踪任务增强检测精度。

    13、s6:模型训练与测试

    14、本发明构建了一种网络模型,应用于计算机视觉领域,尤其针对保障自动驾驶系统在多种恶劣气象条件下的感知能力。为达到预期效果,所提出的网络模型在radiate数据集上接受了训练,该数据集涵盖了多种极端气象环境,增强了模型的环境适应性,数据集中三种感知传感器的融合为模型提供了立体图像、激光雷达和毫米波雷达数据,尽管它们在某些复杂场景下可能存在信号衰减或噪声干扰。

    15、提出的网络模型在准确.性方面显著优于基准算法,robustfusion网络在复杂交通场景下的检测精度map上达到了70.1%,在多目标跟踪精度amota上达到了63.3%,超越基准算法的65.7%map和60.6% amota。

    16、通过可视化展示了robustfusion在复杂环境条件下的性能优势。同时,经过在真实场景nuscenes数据集的测试,同样也证实了其出色的性能及实用性。

    17、s7:将训练好的网络模型部署至智能驾驶车辆;基于ros系统进行实车部署与道路实验,实现实时的目标检测与跟踪。

    18、综上所述,本发明提出的robustfusion网络模型促进了自动驾驶在不同环境条件中的稳定性与准确性,对于恶劣天气条件下的感知系统具有显著的效能提升,为自动驾驶领域贡献了一项高鲁棒性的技术解决方案。

    19、本发明的有益效果:

    20、1.本发明高效融合多源异构传感信息,有效提高了目标检测与跟踪算法在雨雪雾天气等复杂环境下的鲁棒性,降低了环境噪声对环境感知结果的影响。

    21、2.构建基于精确空间信息作为指导的相机视图转化模块,更精确的获得相机图像的bev特征。

    22、3.构建带有先验信息的查询初始化方案,采用基于时序信息的查询增强模块,利用跟踪任务增强检测精度。

    23、4.首次采用lstm与transformer结合的数据关联匹配来跟踪多类目标,跟踪算法中没有显式的状态估计。

    24、5.经过8×tesla v100 gpus的训练与测试,本发明在nuscenes、radiate数据集中显著提高了检测和跟踪算法的准确性,robustfusion在nuscenes的黑夜和雨天复杂环境下的检测精度map为70.1%,多目标跟踪精度amota为63.3%,而基准算法bevfusion的map为65.7%,amota为60.6%,显著提高了恶劣天气条件下的检测和跟踪算法的准确性,为自动驾驶提供一种高精度、高可信性、高安全性的技术方案。


    技术特征:

    1.一种多源异构传感信息融合的目标检测与跟踪网络模型,其特征在于,包括:多模态特征提取与bev特征生成模块、激光雷达指导的相机视图转化模块、带有先验信息的查询初始化模块、基于跨模态注意力机制的特征融合模块、基于lstm与transformer的数据关联匹配模块;

    2.根据权利要求1所述的一种多源异构传感信息融合的目标检测与跟踪网络模型,其特征在于,所述多模态特征提取与bev特征生成模块:在相机图像处理支路中,利用图像特征提取网络vovnet来提取图像特征,其空间维度如公式(1)所示,其生成方法如公式(2)所示;

    3.根据权利要求1所述的一种多源异构传感信息融合的目标检测与跟踪网络模型,其特征在于,所述激光雷达指导的相机视图转化模块:根据图像特征fcamera生成图像bev特征,具体地:

    4.根据权利要求1所述的一种多源异构传感信息融合的目标检测与跟踪网络模型,其特征在于,所述多模态特征提取与bev特征生成模块:在激光雷达点云处理支路中,首先对输入的激光雷达点云进行体素化操作,利用训练好的网络voxelnet将原始的激光雷达点云体素化,转换为统一网格;同时,为了提高计算效率,利用三维稀疏卷积second网络对体素空间中的特征进行编码,形成bev空间中的特征表示,其空间维度为:

    5.根据权利要求1所述的一种多源异构传感信息融合的目标检测与跟踪网络模型,其特征在于,所述多模态特征提取与bev特征生成模块:在毫米波雷达点云处理支路中,首先,采用柱状化处理作为预处理步骤,该过程将原始的毫米波雷达点云数据转化为更加规范化和结构化的表达形式;其次,引入一种基于邻域注意力机制的网络架构作为骨干网络,提取毫米波雷达的bev点云特征,所述毫米波雷达的bev点云特征的空间维度为:

    6.根据权利要求1所述的一种多源异构传感信息融合的目标检测与跟踪网络模型,其特征在于,所述带有先验信息的查询初始化模块的处理过程可以表示如下:

    7.根据权利要求1所述的一种多源异构传感信息融合的目标检测与跟踪网络模型,其特征在于,所述基于跨模态注意力机制的特征融合模块:

    8.根据权利要求1所述的一种多源异构传感信息融合的目标检测与跟踪网络模型,其特征在于,所述基于lstm与transformer的数据关联匹配模块,具体处理过程如下:

    9.根据权利要求8所述的一种多源异构传感信息融合的目标检测与跟踪网络模型,其特征在于,所述基于lstm与transformer的数据关联匹配模块还包括基于时序信息的查询增强模块,该模块用于对物体的运动趋势进行建模,同时与带有先验信息的查询初始化模块结合,通过对连续帧的感知信息进行建模,可以准确地预测和跟踪物体的运动轨迹,实现利用跟踪任务增强检测精度;具体实现过程如下:在基于时序信息的查询增强模块中,将前一帧的查询qt-1以及当前帧的查询qt传递到交叉注意力机制中,前一帧的查询qt-1作为该注意力机制中的查询,实现将前一帧的特征聚合到当前帧的相应查询中,通过这种方式,历史帧信息可以聚合到当前帧,对于新生成的qt,将会被直接用作检测阶段跨模态注意力机制的查询输入。

    10.一种多源异构传感信息融合的目标检测与跟踪方法,其特征在于,将训练好的权利要求1-9任一项所述目标检测与跟踪网络模型部署到车辆,实现实时的目标检测与跟踪。


    技术总结
    本发明公开了一种多源异构传感信息融合的目标检测与跟踪网络模型及方法。近年来,智能汽车环境感知技术取得了显著进展,然而无人驾驶汽车的广泛部署仍未实现,其主要制约因素在于复杂交通场景中行车环境状态估计不准确的问题。为此,本发明提出了一种高效融合多源异构传感信息的方法,构建了精确空间信息指导的相机视图转换模块,并设计了带有先验信息的查询初始化模块。此外,本发明采用基于时序信息的查询增强模块,通过跟踪任务提高检测精度,结合LSTM与Transformer的数据关联匹配策略,实现了多目标跟踪。经过8×Tesla V100GPUs的训练,本发明在nuScenes和RADIATE数据集上显著提升了检测和跟踪算法的准确性,为自动驾驶提供了一种高精度、高可信性和高安全性的技术方案。

    技术研发人员:王海,邵政,蔡英凤,陈龙,李祎承,孙晓强,刘擎超,董浩然,曹吴鸿
    受保护的技术使用者:江苏大学
    技术研发日:
    技术公布日:2024/10/24
    转载请注明原文地址:https://symbian.8miu.com/read-48096.html

    最新回复(0)