具有不确定运动模型的基于模型的控制的制作方法

    技术2026-07-24  5


    本发明总体上涉及基于模型的控制,并且更具体地涉及用于使用经受约束的概率滤波器来控制机器人系统的操作的概率控制。


    背景技术:

    1、基于优化的控制(诸如,模型预测控制(model predictive control,mpc)或状态反馈控制)允许基于模型的设计框架,其中,可以直接考虑系统动力学(dynamics)和状态以及输入约束。mpc被用于许多应用中以控制具有各种复杂性的动力学系统。这种系统的示例包括生产线、汽车引擎、机器人、数控加工、卫星和发电机。

    2、例如,mpc是基于系统的模型的实时有限范围(horizon)优化。mpc具有预测未来事件并采取适当控制动作的能力。这是通过在经受状态和输入约束的未来有限时间范围上优化系统的操作并且仅在当前时间步长上实现控制来实现的。

    3、mpc可以预测由控制变量的改变引起的建模系统的状态变量的改变。状态变量定义系统的状态,即,受控系统的状态是控制系统的状态空间表示中的状态变量的最小集合,其可以表示系统在任何给定时间的整个状态。例如,如果受控系统是机器人系统(诸如,自主车辆),则状态变量可以包括车辆的位置、速度和航向。控制变量是被设计成改变机器状态的系统的输入。例如,在化学过程中,控制变量通常是压力、流量、温度、阀的开度(opening)和阻尼器的刚度。这些过程中的状态变量是表示控制目标或过程约束的其它测量结果。

    4、mpc使用系统的模型、当前系统测量结果、过程的当前动力学状态以及状态和控制约束来计算状态变量的未来改变。计算这些改变以保持接近目标的状态变量经受对控制变量和状态变量两者的约束。mpc通常仅发出要实现的每个控制变量中的第一改变,并且当需要下一个改变时重复计算。

    5、基于模型的控制的性能不可避免地取决于在最优控制计算中使用的预测模型的质量。预测模型描述系统的动力学,即,系统的时间评估。例如,预测模型是描述系统的动力学以基于对系统的控制输入来连接受控系统的先前状态和当前状态的非线性函数。

    6、然而,在许多应用中,受控系统的运动模型是部分未知的或不确定的,并且另外,受控系统的未知部分通常经受结构约束。在这种情况下,对不确定模型应用控制可能导致次优性能或甚至导致受控系统的不稳定性。例如,在一些情况下,运动模型的一些参数没有被精确地测量。因此,控制器可能需要估计机器模型的未知参数。处理这些问题的常规方法包括自适应或基于学习的mpc,其中,mpc控制问题用闭环识别方案增强,以便学习未知机器参数。通过学习未知参数,改善了由控制器实现的机器的操作。参见例如u.s.2011/0022193。

    7、[引用列表]

    8、[专利文献]

    9、[ptl1]u.s.2011/0022193


    技术实现思路

    1、技术问题

    2、然而,作为运动模型的参数的不确定性的附加或替代,在一些情况下,系统的动力学正在改变,即,受控系统的连续状态之间的函数关系。在这些情况下,用于估计模型的参数的自适应或基于学习的方法可能不足。

    3、另外,因为系统的动力学正在改变,所以应当递归地(即,实时地)完成伴随控制器的学习。然而,当受控系统经受结构约束并且此类约束未被并入学习过程中时,学习变得低效,或者其学习不是物理的并且因此不能用于后续控制的系统。

    4、因此,需要一种基于模型的控制器,其可以通过将结构约束结合到学习过程中来实时学习控制系统的动力学的运动模型。

    5、一些实施方式的目的是使用描述系统的动力学的运动模型来提供机器人系统的概率控制。附加地或替代地,一些实施方式的另一目的是使用具有不确定性的运动模型来提供对系统的基于模型的控制。附加地或替代地,一些实施方式的另一个目的是使用系统的动力学中具有不确定性的运动模型来提供系统的基于模型的控制,其中,机器人系统的操作经受结构约束。附加地或替代地,当系统的运动的参数和/或动力学未知和/或部分已知时,并且当将结构约束并入到运动模型的估计中时,一些实施方式的另一目的是估计受控机器人系统的运动模型。

    6、问题的解决方案

    7、通常,机器人系统可以用至少两个模型(等式)建模。第一模型是使系统的状态与系统的先前状态和系统的输入相关的机器人系统的运动模型。运动模型捕获系统的动力学。运动模型通常包括表示运动模型的不确定性的噪声或干扰和/或模型外部干扰。该不确定性在本文中被称为过程噪声。第二模型是将系统的可用测量结果与系统的状态相关的测量模型。测量模型还包括测量噪声和/或本文中称为测量噪声的其它不确定性。在本文中,这些不确定性被称为模型不确定性。

    8、另外,系统的状态也经受不确定性,在本文中称为状态不确定性。值得注意的是,过程噪声和测量噪声结合模型不确定性导致状态不确定性。然而,虽然状态不确定性和模型不确定性是紧密相连的,但是它们不同于过程噪声和测量噪声。具体地,状态不确定性在系统的状态和模型的值内部,而过程噪声和测量噪声是对状态的外部干扰。

    9、当过程噪声、测量噪声和模型已知时,即,过程噪声和测量噪声的分布的形状和参数以及描述模型的非线性函数已知时,各种技术允许例如使用卡尔曼滤波器或粒子滤波器来估计系统的状态和状态不确定性两者。系统的状态和状态不确定性对于许多控制应用都是重要的。例如,系统的状态可以用于确定对系统的控制输入以实现控制目标,而状态不确定性可以用于调整控制输入以确保控制的可行性。

    10、例如,当过程噪声和测量噪声的分布已知并且运动模型和测量模型已知时,粒子滤波器可以用于用一组粒子来表示系统的状态和状态不确定性,其中,系统的状态是粒子的加权组合,其中,权重是根据与测量模型拟合的粒子来确定的。

    11、然而,在若干应用中,运动模型在运行时间之前不是完全已知的,例如,对于在道路上行驶的车辆,除非车辆正在移动,否则不能感测表面,并且任何控制器都基于运动模型,该运动模型在启动阶段是不确定的,或者甚至是完全未知的。附加地或替代地,系统的动力学可以是未知的、部分已知的或随时间改变的。

    12、因此,对于一些应用,不仅需要估计系统的当前状态的分布,还需要估计系统的运动模型。为此,一些实施方式在给定先前状态、测量模型以及分别扰动运动模型和测量模型的过程噪声和测量噪声的情况下估计系统的状态和运动模型。

    13、估计系统的运动模型的任务可以被视为降低运动模型的不确定性的任务。运动模型使表示机器人系统的结构和操作配置的机器人系统的参数与表示具有参数的机器人系统的操作的输入和输出的变量相关。因此,降低运动模型的不确定性是确定地学习运动模型的参数。例如,学习参数可以是学习由机械臂承载的负载的实际质量的任务。虽然该任务本身具有挑战性,但是为了进一步使这一点复杂化,运动模型的参数可以是随时间改变的函数。例如,车辆与道路的摩擦基于多个不同因素随时间改变,诸如车辆的速度和加速度和/或道路表面的类型。为此,一些实施方式的目的是学习影响机器人系统的操作的参数的函数。

    14、一些实施方式基于以下理解:运动模型的参数的不确定性或影响机器人系统的操作的参数的函数的不确定性可以表示为时变高斯过程。一些实施方式基于以下认识:由于参数的函数的时变性质,为了更新运动模型,需要更新高斯过程,这是计算上具有挑战性的问题。然而,一些实施方式基于以下理解:高斯过程可以被建模为一组加权基函数,其中权重根据高斯分布来分布。这样做显著简化了学习问题,因为学习模型的问题被减少为学习相应基函数的权重。换句话说,为了更新高斯过程,一些实施方式可以仅更新权重的这些高斯分布,并且为了确定运动模型,一些实施方式可以仅从高斯分布确定n个标量权重。

    15、实际上,将运动模型视为基函数的加权组合显著降低了以概率方式估计轮胎摩擦的计算要求。例如,在一些实施方式中,高斯过程被表示为具有由对应高斯分布定义的权重的时变基函数的加权组合,使得高斯过程的时变均值是利用对应高斯分布的均值修改的基函数的函数,并且高斯过程的时变方差是利用对应高斯分布的方差修改的基函数的函数。

    16、然而,虽然使用基函数表示高斯过程简化了计算,但是该表示产生了附加问题。具体地,在多种情况下,参数的函数具有反映参数和/或机器人系统的性质的结构。例如,参数的函数可以是对称的,指示参数的变化对系统的性能的影响的对称性。参数的函数的结构可以是非对称的,如在轮胎摩擦示例中,这可能影响机器人系统的操作的李雅普诺夫(lyapunov)稳定性等。为此,需要执行参数的函数的不确定性的高斯过程的更新经受对函数形状的约束。这种约束在本文中被称为结构约束。

    17、结构约束的类型从机器人系统的状态的测量结果中是显而易见的。具体地,机器人系统在不同时刻的状态的测量结果序列指示对影响机器人系统的操作的参数的函数的形状的结构约束。这种依赖性是概率性的,但是在不同种类的机器人系统之间存在并且变化。

    18、为此,一些实施方式的目的是更新高斯过程,该高斯过程指示经受对影响机器人系统的操作的参数的函数的形状的结构约束的参数的函数的不确定性。附加地或替代地,一些实施方式的目的是使用这些双重更新来执行对系统的状态的跟踪,即,使用机器人系统的运动模型和测量模型来更新机器人系统的状态,并且更新运动模型的潜在时变参数的时变高斯过程。

    19、不幸的是,经受结构约束的高斯过程的受约束更新在计算上具有挑战性,其程度使得对于一些应用,这样的受约束更新是不切实际的。

    20、一些实施方式基于以下认识:当高斯过程由基函数的加权组合表示时,可以对基函数的形状的选择施加结构约束。也就是说,如果基于结构约束以预定义方式选择基函数,则这些基函数的任何加权组合也将满足结构约束。作为简单的示例,如果对参数的函数的形状的结构约束是形状不对称的,则基函数需要是奇数的。相反,如果形状是对称的,则基函数甚至需要被选择为偶数的。以这种方式,受约束更新被替换为基于由机器人系统的状态的测量结果序列指示的结构约束的基函数的选择,随后是由这些选择的基函数表示的高斯过程的无约束更新,这在计算上比受约束更新高效得多。

    21、因此,一个实施方式公开了一种概率反馈控制器,其使用经受对机器人系统的操作的结构约束的概率滤波器来控制机器人系统的操作,该概率反馈控制器包括:至少一个处理器;以及存储器,其上存储有指令,所述指令在由所述至少一个处理器执行时,使控制器:收集机器人系统的状态在不同时间实例处的测量结果序列的数字表示,该测量结果序列指示对影响机器人系统的操作的参数的函数的形状的结构约束;执行概率滤波器,该概率滤波器被配置为基于被随机过程噪声扰动的机器人系统的运动模型和被随机测量噪声扰动的机器人系统的测量模型,在给定机器人系统的先前状态的情况下递归地估计机器人系统的当前状态的分布,其中,所述运动模型、所述过程噪声、所述测量模型和所述测量噪声中的一者或组合包括具有被建模为时变高斯过程的不确定性的所述参数,所述时变高斯过程被表示为时变基函数与由对应高斯分布定义的权重的加权组合,使得高斯过程的时变均值是利用对应高斯分布的均值修改的基函数的函数,并且高斯过程的时变方差是用对应高斯分布的方差修改的基函数的函数,其中,概率滤波器递归地更新机器人系统的当前状态的分布和基函数的权重的高斯分布两者,并且其中,每个基函数被选择为满足由机器人系统的状态的测量结果序列指示的结构约束;并且执行基于机器人系统的当前状态的分布的估计确定的控制动作,以根据控制目标改变机器人系统的当前状态。

    22、另一实施方式公开了一种使用经受对机器人系统的操作的结构约束的概率滤波器来控制机器人系统的操作的方法,其中,所述方法使用与实现所述方法的存储指令联接的处理器,其中,所述指令在由处理器执行时,执行该方法的步骤,该方法包括以下步骤:收集机器人系统的状态在不同时间实例处的测量结果序列的数字表示,该测量结果序列指示对影响机器人系统的操作的参数的函数的形状的结构约束;执行概率滤波器,该概率滤波器被配置为基于被随机过程噪声扰动的机器人系统的运动模型和被随机测量噪声扰动的机器人系统的测量模型,在给定机器人系统的先前状态的情况下递归地估计机器人系统的当前状态的分布,其中,运动模型、过程噪声、测量模型和测量噪声中的一者或组合包括具有被建模为时变高斯过程的不确定性的参数,时变高斯过程被表示为时变基函数与由对应高斯分布定义的权重的加权组合,使得高斯过程的时变均值是利用对应高斯分布的均值修改的基函数的函数,并且高斯过程的时变方差是用对应高斯分布的方差修改的基函数的函数,其中,概率滤波器递归地更新机器人系统的当前状态的分布和基函数的权重的高斯分布,并且其中,每个基函数被选择为满足由机器人系统的状态的测量结果序列指示的结构约束;并且执行基于机器人系统的当前状态的分布的估计确定的控制动作,以根据控制目标改变机器人系统的当前状态。

    23、又一实施方式公开了一种非暂时性计算机可读存储介质,其上具体实现有可由处理器执行以用于执行方法的程序,所述方法包括收集机器人系统的状态在不同时间实例处的测量结果序列的数字表示,所述测量结果序列指示对影响机器人系统的操作的参数的函数的形状的结构约束;执行概率滤波器,该概率滤波器被配置为基于被随机过程噪声扰动的机器人系统的运动模型和被随机测量噪声扰动的机器人系统的测量模型,在给定机器人系统的先前状态的情况下递归地估计机器人系统的当前状态的分布,其中,运动模型、过程噪声、测量模型和测量噪声中的一者或组合包括具有被建模为时变高斯过程的不确定性的参数,所述时变高斯过程被表示为时变基函数与由对应高斯分布定义的权重的加权组合,使得高斯过程的时变均值是利用对应高斯分布的均值修改的基函数的函数,并且高斯过程的时变方差是用对应高斯分布的方差修改的基函数的函数,其中,概率滤波器递归地更新机器人系统的当前状态的分布和基函数的权重的高斯分布,并且其中,每个基函数被选择为满足由机器人系统的状态的测量结果序列指示的结构约束;并且执行基于机器人系统的当前状态的分布的估计确定的控制动作,以根据控制目标改变机器人系统的当前状态。


    技术特征:

    1.一种概率反馈控制器,所述概率反馈控制器使用经受对机器人系统的操作的结构约束的概率滤波器来控制所述机器人系统的操作,所述概率反馈控制器包括:至少一个处理器;以及存储器,所述存储器上存储有指令,所述指令在由所述至少一个处理器执行时使所述控制器:

    2.根据权利要求1所述的概率反馈控制器,其中,所述机器人系统的所述状态的所述测量结果序列中的每个测量结果通过所述运动模型和所述测量模型中的一者或组合与所述参数的值相关,使得所述机器人系统的状态的测量结果序列与统计地保存对所述参数的所述函数的所述形状的结构约束的所述参数的值序列相关。

    3.根据权利要求2所述的概率反馈控制器,其中,拟合到所述参数的值序列中的数据的平滑表示包括具有保存所述结构约束的形状的函数。

    4.根据权利要求2所述的概率反馈控制器,其中,所述参数的值序列的统计属性依赖于所述结构约束。

    5.根据权利要求2所述的概率反馈控制器,其中,施加所述参数的所述函数的所述形状的所述结构约束减小了使用具有所述参数的所述运动模型预测的所述机器人系统的状态与测量的所述机器人系统的状态之间的差异。

    6.根据权利要求1所述的概率反馈控制器,其中,基于所述机器人系统的所述操作的实验数据或模拟数据离线确定所述结构约束,使得响应于确定所述结构约束而离线选择所述基函数。

    7.根据权利要求1所述的概率反馈控制器,其中,在所述机器人系统的控制期间在线确定所述结构约束,使得响应于确定所述结构约束而在所述机器人系统的操作期间选择所述基函数。

    8.根据权利要求7所述的概率反馈控制器,其中,为了选择所述基函数,所述处理器被配置为:

    9.根据权利要求7所述的概率反馈控制器,其中,为了选择所述基函数,所述处理器被配置为:

    10.根据权利要求9所述的概率反馈控制器,其中,所述模式被表示为取决于所述参数的方程组,使得能够求解所述方程组的所述基函数满足所述结构约束。

    11.根据权利要求1所述的概率反馈控制器,其中,所述概率滤波器是具有运动模型的卡尔曼滤波器,所述运动模型包括插入到所述卡尔曼滤波器中的所述参数,允许所述概率滤波器执行所述机器人系统的状态和所述时变高斯过程的双重更新。

    12.根据权利要求1所述的概率反馈控制器,其中,所述概率滤波器是具有运动模型的粒子滤波器,所述运动模型包括与每个粒子滤波器相关联的参数,允许所述概率滤波器执行所述机器人系统的状态和所述时变高斯过程的双重更新。

    13.根据权利要求1所述的概率反馈控制器,其中,为了满足所述结构约束,每个所述基函数被选择为奇函数;。

    14.根据权利要求1所述的概率反馈控制器,其中,为了满足所述结构约束,每个所述基函数被选择为偶函数。

    15.根据权利要求1所述的概率反馈控制器,其中,所述机器人系统包括在具有不确定路面状况的道路上行驶的车辆,所述不确定路面状况被建模为由奇基函数的加权组合表示的时变高斯过程。

    16.根据权利要求15所述的概率反馈控制器,其中,所述参数的函数是摩擦函数,并且所述摩擦函数的形状是非对称的。

    17.根据权利要求1所述的概率反馈控制器,其中,所述机器人系统包括多个车辆,所述多个车辆形成不确定交通流量,所述不确定交通流量被建模为跨不同区段的时变高斯过程,其中,每个区段由奇基函数或偶基函数的加权组合表示。

    18.根据权利要求1所述的概率反馈控制器,其中,所述机器人系统包括由非线性函数表示的磁场控制的一组无人机,所述非线性函数具有无卷曲的结构约束,使得所述基函数被选择为正弦基函数和余弦基函数的组合。

    19.一种使用概率滤波器来控制机器人系统的操作的方法,所述概率滤波器经受对所述机器人系统的操作的结构约束,其中,所述方法使用与实现所述方法的存储的指令联接的处理器,其中,所述指令在由所述处理器执行时执行所述方法的步骤,所述方法包括以下步骤:

    20.一种非暂时性计算机可读存储介质,所述非暂时性计算机可读存储介质上具体实现有程序,所述程序能够由处理器执行以执行方法,所述方法包括以下步骤:


    技术总结
    一种使用经受对机器人系统的操作的结构约束的概率滤波器来控制机器人系统的操作的概率反馈控制器被配置为执行概率滤波器,所述概率滤波器基于被随机过程噪声扰动的机器人系统的运动模型和被随机测量噪声扰动的机器人系统的测量模型在给定机器人系统的先前状态的情况下估计机器人系统的当前状态的分布,所述随机测量噪声具有被建模为时变高斯过程的不确定性,所述时变高斯过程被表示为时变基函数与由对应高斯分布定义的权重的加权组合。概率滤波器递归地更新机器人系统的当前状态的分布和被选择为满足由机器人系统的状态的测量结果指示的结构约束的基函数的权重的高斯分布两者。

    技术研发人员:K·贝恩拓普,M·门纳
    受保护的技术使用者:三菱电机株式会社
    技术研发日:
    技术公布日:2024/10/24
    转载请注明原文地址:https://symbian.8miu.com/read-45817.html

    最新回复(0)