本发明涉及一种生成环境表示的方法。本发明还涉及用于此目的的机器学习模型、计算机程序、装置以及存储介质。
背景技术:
1、棒状像素(stixel)和自由空间的检测是机器人技术和自推进或自主系统中的一项重要任务,因为它们使得能够表示自主代理可以移动的区域。同样,由此可以表示对碰撞对象有危险并因此需要避开以进行安全导航的区域。
2、深度神经网络领域的最新进展使得显著提高检测棒状像素和自由空间算法的性能和鲁棒性成为可能。以下文章阐述了基于深度学习的解决方案示例:“levi et al.,stixelnet:adeep convolutional network for obstacle detection and roadsegmentation,in:bmvc 2015,pages 109.1-109.12”和“verner et al.,real-timecategory-based and general obstacledetection for autonomous driving,in:iccv2017”。
3、尽管棒状像素和自由空间检测可以在所阐述的系统中提供良好的结果,但它们通常不适用于具有不同分辨率的图像。当打算为具有不同分辨率的不同摄像头提供棒状像素/自由空间检测算法时,这种限制可能很关键。
技术实现思路
1、根据说明书和附图,本发明的进一步特征和细节将变得清楚。在这种情况下,结合根据本发明的方法描述的特征和细节当然也可以结合根据本发明的机器学习模型、根据本发明的计算机程序、根据本发明的装置以及根据本发明的计算机可读存储介质来应用,反之亦然,因此,关于公开内容,总是相互参照或可以相互参照本发明的各个方面。
2、本发明尤其涉及一种生成环境表示的方法,该方法包括以下步骤,这些步骤优选地可以连续和/或重复和/或以自动化方式执行:
3、-提供至少一个图像,所述至少一个图像由至少一个图像捕获装置的记录而产生并且示出所述至少一个图像捕获装置的环境中的至少一个对象和/或可导航区域,所述图像被设计成被分割成多个图像列,
4、-生成环境表示,至少一个所提供的图像的相应图像列的(特别是恰好)一个棒状像素和/或自由空间元素为此目的而被参数化以便表示所述对象和/或所述可导航区域。
5、可导航区域也可以称为自由空间。此外,可以提供恰好一个或多个所述至少一个图像,并且可以提供所述至少一个图像捕获装置中的恰好一个或多个不同的图像捕获装置,它们在必要时提供不同分辨率的图像。因此,图像还可以示出不同的对象和/或可导航区域,优选地以不同的分辨率。该方法还可以用在单个系统或者包括不同图像捕获装置的不同系统(例如机器人和/或车辆)中。
6、在本发明的上下文中,环境表示可以至少部分地基于模型的输出来生成,该模型可以被适配成(特别是在不修改模型和/或不重新训练模型的情况下)处理作为输入的不同分辨率(特别是具有不同图像列高度)的至少一个所提供的图像。换句话说,该模型可以被配置为使得(特别是在不修改模型和/或不重新训练模型的情况下)它可以处理不同分辨率的图像,并且因此该模型也可以用于处理来自具有不同分辨率的不同图像捕获装置的图像。例如,当模型不仅预测单个棒状像素和/或自由空间元素,而且预测多个可能的棒状像素和/或自由空间元素参数(例如每图像列的多个供选择的位置)时,这是可能的。优选地,在这种情况下,模型被配置为机器学习模型。例如,可以规定使用棒状像素自由空间cnn解码器架构,其允许多分辨率推理。此外,可以使用基于序数回归的鲁棒的棒状像素自由空间参数化。因此,根据本发明的方法具有以下优点:可以为多分辨率棒状像素和/或自由空间检测提供特别是基于机器学习并且优选地基于cnn的解决方案。这使得将棒状像素和自由空间应用于具有不同分辨率的图像成为可能。
7、表述“棒状像素和/或自由空间元素”可以尤其涉及棒状像素和/或用于自由空间表示的元素。模型的输出可以例如包括用于表示对象和/或自由空间的相应棒状像素和/或自由空间的至少一个参数。例如,所述至少一个参数包括图像列中的位置。棒状像素元素皆可以被配置为棒状像素,并且可以表示下一个障碍物的最低点到最高点的高度,并且可以为此目的而被相应地参数化。还可以可选地为棒状像素分配类标签以及距该障碍物的距离。
8、所述至少一个图像可以例如这样被提供、优选地被确定:所述至少一个图像是作为数字输入处理的。因此,所述至少一个图像可以被配置为至少一个数字图像并且因此可以包括数字数据。在这种情况下,图像可以例如已经经由接口从图像捕获装置的电子图像传感器获得,特别是借助于模数转换获得。这意味着至少一个所提供的图像可以由图像捕获装置的记录产生。在这种情况下,方法步骤以及优选地所述至少一个图像的提供可以由电子数据处理装置和/或由计算机程序来执行,可选地至少部分地也在图像捕获装置(例如摄像头本身)内执行。
9、例如,相应的棒状像素元素被配置为棒状像素,优选地配置为“单个棒状像素”(与“多棒状像素”相反)。每个棒状像素可以代表环境中的对象和/或表面的至少一部分,特别是自我车辆和/或机器人。在本发明的上下文中,棒状像素也可以被称为深度表示。特别是在计算机视觉中,棒状像素被理解为图像中的深度信息的垂直棒(也称为条带)形式的超像素表示。这种表示使得可以逼近场景的某个垂直部分内最接近的障碍物(参见badino,hernán;franke,uwe;pfeiffer,david(2009).the stixel world–a compact medium levelrepresentation of the 3d-world.joint pattern recognition symposium)。在这种情况下,还可以以窄垂直矩形的形式提供棒状像素,它们表示属于所观察的场景中(即,环境中)最接近的对象的垂直表面的一段。在出现此类问题时,它们使得可以大大减少表示场景所需的信息量。在这种情况下,棒状像素可以由多个参数来表征,例如垂直坐标(位置),和/或条带的高度,和/或深度。这里,不同的深度例如由从包括图像捕获装置的车辆(即,自我车辆或机器人)开始的环境中的对象或表面的距离产生。
10、另外,如果基于所生成的环境表示的至少部分自动化的评估,优选地以至少部分自动化的方式并且优选地自主地控制至少部分自主的机器人(特别是车辆),则是有利的,图像捕获装置优选地被设计为机器人的摄像头。机器人还可以包括多个图像捕获装置,它们被配置成提供不同分辨率的图像。具体地,可以规定,基于环境表示的自动化评估,以自动化方式并且优选地自主地控制车辆,其中(相应的)图像捕获装置以摄像头的形式安装在车辆上。车辆可以被设计为机动车辆和/或乘用车和/或自驾驶车辆。车辆可以包括车辆设备,例如用于提供自主驾驶功能和/或驾驶员辅助系统。车辆设备可以被配置成至少部分地自动控制和/或加速和/或制动和/或转向车辆。
11、此外,可以设想,模型被配置为机器学习模型,并且优选地包括至少一个或恰好一个人工神经网络(优选地采用cnn的形式,特别优选地是全卷积cnn)。在这种情况下,cnn也称为卷积神经网络。这里,模型的输出(优选地采用输出张量的形式)可以指示相应图像列中的棒状像素和/或自由空间元素的多个可能的并且优选地另选的位置。然后可以基于所指示的可能位置来参数化棒状像素和/或自由空间元素,优选地通过从每图像列的多个可能(另选)位置中选择棒状像素和/或自由空间元素的一个(特别是恰好一个)位置。例如,这可以借助于序数回归来进行。在这种情况下,可以优选地仅利用所选择的位置来参数化棒状像素和/或自由空间元素。这使得模型可以被训练成利用单个棒状像素和/或自由空间元素(特别是单个棒状像素而不是多棒状像素),针对高度输出多个可能的像素位置,然后能够被选择和使用。序数回归可以在这里使用投票机制来选择可能的位置。
12、在另一选项中,可以规定,相应的棒状像素和/或自由空间元素这样被参数化:至少通过最低点来定义相应的棒状像素和/或自由空间元素,优选地向所述最低点指派关于由该棒状像素和/或自由空间元素表示的对象的距离的深度信息。在这种情况下,可以执行序数回归以用于相应的棒状像素和/或自由空间元素的参数化,优选地以便确定该棒状像素和/或自由空间元素的最低点。因此可以在图像的每一列的像素坐标中确定下部点以及可选地上部点的位置。此外,类名称和深度信息(例如距对象的距离)也可以可选地由模型针对每个图像列确定。
13、优选地,可以规定,所述模型被适配成这样处理作为输入的不同分辨率的至少一个所提供的图像:当处理所提供的图像时,所述图像列的高度基本上由所述模型维持。然而,常规的解决方案总是通过所谓的“聚集(clumping)”将高度降低到1像素,并直接输出单个棒状像素。还可以规定,所述模型被适配成这样处理作为输入的不同分辨率的至少一个所提供的图像:所述棒状像素和/或自由空间元素的多个可能的以及可选地另选的位置在相应图像列中被确定并且可供在所述输出中选择。在这种情况下,由所述模型确定和/或输出的可能位置的数量可以取决于所提供的图像的分辨率。这与以下事实有关:分辨率越高,图像列中可能位置的数量也就越多。优选地,所述不同分辨率在所述图像列的高度方面有所不同,所述模型特别优选地被适配成处理至少10个、至少100个或至少1000个不同分辨率的图像。
14、此外,所述模型可以被配置为机器学习模型,所述机器学习模型在已训练状态或经训练状态下还被配置成输出在应用期间在所述输入的不同分辨率下相应图像列的所述棒状像素和/或自由空间元素的预测。在这种情况下,所述已训练状态可以由所述机器学习模型的训练产生,其中,用于所述训练的训练数据包括处于与所述应用期间的所述输入的分辨率不同的分辨率的多个图像。换句话说,模型可以已经以与后续应用中使用的分辨率不同的分辨率进行了训练,而无需重新训练模型。
15、本发明还涉及一种机器学习模型,所述机器学习模型被配置成处理作为输入的不同分辨率的被分割成多个图像列的图像,以便预测所述图像列的相应的棒状像素和/或自由空间元素的每图像列的多个可能位置。在这种情况下,所述图像可以由至少一个图像捕获装置的记录而产生并且示出所述至少一个图像捕获装置的环境中的至少一个对象和/或可导航区域。同样,相应的棒状像素和/或自由空间元素可以被配置成表示所述对象和/或所述可导航区域。因此,根据本发明的机器学习模型具有与参照根据本发明的方法详细描述的相同的优点。常规的解决方案通常无法处理与训练时不同的摄像头分辨率。根据本发明的方法可以提供以下优点:机器学习模型是以固定分辨率训练的,但训练后可以应用于具有不同分辨率的图像捕获装置,例如摄像头,而无需重新训练。结果,例如可以减少标记训练数据所需的工作量,因为可以使用具有固定分辨率的数据集来对多个不同的图像捕获装置或摄像头分辨率进行训练。另外,单个机器学习模型(特别是cnn)的通用性可以借助于具有不同分辨率的不同摄像头实现。因此,没有必要为每个新摄像头训练单独的机器学习模型。
16、本发明还涉及一种包括命令的计算机程序,特别是计算机程序产品,当所述计算机程序由计算机执行时,所述命令使所述计算机执行根据本发明的方法。因此,根据本发明的计算机程序具有与参照根据本发明的方法详细描述的优点相同的优点。
17、本发明还涉及一种被配置成执行根据本发明的方法的数据处理装置。作为示例,可以提供执行根据本发明的计算机程序的计算机作为该装置。该计算机可以包括至少一个用于执行所述计算机程序的处理器。还可以提供非易失性数据存储器,该非易失性数据存储器中存储所述计算机程序,并且处理器可以从该非易失性数据存储器中读出所述计算机程序以供执行。
18、本发明还涉及一种计算机可读存储介质,所述计算机可读存储介质包括根据本发明的计算机程序和/或命令,当所述命令由计算机执行时,使所述计算机执行根据本发明的方法。作为示例,存储介质被设计为数据存储器,例如硬盘驱动器和/或非易失性存储器和/或存储器卡。存储介质可以例如集成在计算机中。存储介质同样可以包括根据本发明的机器学习模型。
19、此外,根据本发明的方法还可以被配置为计算机实现的方法。
1.一种生成环境表示(90)的方法(100),所述方法包括以下步骤:
2.根据权利要求1所述的方法(100),
3.根据前述权利要求中任一项所述的方法(100),
4.根据前述权利要求中任一项所述的方法(100),
5.根据前述权利要求中任一项所述的方法(100),
6.根据前述权利要求中任一项所述的方法(100),
7.一种机器学习模型(50),所述机器学习模型被配置成处理作为输入(51)的不同分辨率的被分割成多个图像列(41)的图像(40),以便预测所述图像列(41)的相应的棒状像素和/或自由空间元素(30)的每图像列(41)的多个可能位置,所述图像(40)由至少一个图像捕获装置(25)的记录而产生并且示出所述至少一个图像捕获装置(25)的环境中的至少一个对象(60)和/或可导航区域(65),并且相应的棒状像素和/或自由空间元素(30)被配置成表示所述对象(60)和/或所述可导航区域(65)。
8.一种计算机程序(20),所述计算机程序包括命令,当所述计算机程序(20)由计算机(10)执行时,所述命令使所述计算机执行根据权利要求1至6中任一项所述的方法(100)。
9.一种数据处理装置(10),所述数据处理装置被配置成执行根据权利要求1至6中任一项所述的方法(100)。
10.一种计算机可读存储介质(15),所述计算机可读存储介质包括命令,当所述命令由计算机(10)执行时,使所述计算机执行根据权利要求1至6中任一项所述的方法(100)的步骤。
