基于策略重要性识别和值函数矫正的机器人奔跑控制方法

    技术2026-09-09  5


    本发明涉及机器人控制,尤其涉及一种基于策略重要性识别和值函数矫正的机器人奔跑控制方法。


    背景技术:

    1、传统的在线强化学习方法需要智能体不断与环境交互,以收集数据和更新策略。然而,在一些实际应用中,实时交互可能是不现实的或危险的。离线强化学习使用预先收集的静态数据集进行训练,而不需要与环境进行实时交互。离线强化学习目前已经在各个领域得到了广泛应用,包括医疗、金融交易、工业控制、自动驾驶等。

    2、离线数据集是由人类或者计算机的策略,即行为策略,与真实环境交互得到的。离线强化学习就是避免和真实环境交互,而直接从已有的历史数据中学习行为策略。在例如自动驾驶的过程中,需要时时与环境交互的在线强化学习显然是不可行的,在这种情况下,通过离线强化学习学习到好的目标策略就显得尤为重要。

    3、离线强化学习的核心优势在于其能够充分利用历史数据进行训练,避免了实时交互中的风险和成本,特别适用于高风险和高成本的应用场景。通过针对特定领域的优化和改进,离线强化学习可以实现高效的数据处理和策略优化,满足复杂环境中的应用需求。

    4、cql通过一个简单的q值正则化器增强了标准贝尔曼误差目标,该正则化器可以直接在现有的深度q学习和actor-critic实现之上应用。在离散和连续控制领域的实验结果表明,cql显著优于现有的离线强化学习方法,通常学习的策略在最终回报上可以提高2-5倍,特别是在从复杂和多模态数据分布中学习时。cql通过在学习过程中对q值进行过度保守的估计来避免过度乐观的问题,这可能导致策略变得过于保守,从而限制学习性能的提升。在一些需要精确决策和敏捷响应的场景中,过度保守可能会导致策略性能不足。虽然cql减少了对未见数据的依赖,但其保守估计的特性可能限制了模型在新环境中的适应性和泛化能力,尤其是在离线数据与真实环境差异较大时。

    5、iql方法不需要评估数据集之外的动作,但仍然能够显著改进学习到的策略。我们的主要见解是,通过将状态值函数视为随机变量来隐式地进行策略改进步骤,而不是直接评估最新策略中未见的动作。该方法利用了函数逼近器的泛化能力,在避免过度乐观的同时,估计给定状态下最佳可用动作的值,而无需直接查询未见的动作的q值。iql使用期望回归来估计动作价值的上界,这种方法的准确性依赖于合适的期望阈值的选择。如果阈值设置不当,可能无法准确捕捉到最优或次优动作的价值,从而影响策略的最终性能。虽然iql能进行多步动态规划更新,但这种更新依赖于对数据集动作支持的精确估计。在实际应用中,对复杂环境动态的精确建模仍然是一个挑战,这限制了iql在更复杂或更变化多端的环境中的应用。

    6、popo算法是一种专门针对离线强化学习任务设计的算法,它在整个函数空间内考虑初始状态下的悲观估计,而不是单点的悲观估计,来应对缺乏详尽探索的数据集中的推理问题。而提供了更广泛的适应性和鲁棒性。popo算法通过引入悲观主义来避免高估值问题,但这种保守的策略可能导致过度悲观主义。在某些情况下,算法可能过度低估潜在的高回报区域,导致无法发现最优策略。过度悲观的估计会阻碍策略改进,从而在理论上限制了算法的性能上限。

    7、模型预测控制(model predictive control,mpc)是一种先进的控制策略,广泛应用于工业过程控制、机器人控制、无人驾驶等领域。它利用系统的动力学模型预测未来行为,通过优化当前控制输入,达到期望的控制目标。这种方法高度依赖于动力学模型的准确性。此外,mpc需要在每个采样时刻在线求解一个优化问题,计算量大,对实时性要求高的系统可能不适用。

    8、中央模式发生器(central pattern generator,cpg)是一种基于神经生物学的控制方法,模拟脊椎动物和无脊椎动物的神经网络结构,用于产生节律性运动,如行走、游泳、呼吸等。cpg在机器人控制领域尤其在仿生机器人中的应用非常广泛。cpg擅长生成周期性运动,但在复杂的非周期性运动生成方面存在局限。


    技术实现思路

    1、本发明要解决的技术问题是针对上述现有技术的不足,提供一种基于策略重要性识别和值函数矫正的机器人奔跑控制方法,有效缓解由ood引起的高估问题,提高智能体在真实环境下的表现性能以及在新环境下的稳定性和鲁棒性。

    2、为解决上述技术问题,本发明所采取的技术方案是:

    3、一种基于策略重要性识别和值函数矫正的机器人奔跑控制方法,使用当前策略的值函数与行为策略的值函数的差代替选择策略的标准;采用策略重要性对策略进行加权评估,即面对不同的策略时,对每种策略进行动态评估,选取一个对长期回报最优的动作;采用q函数协同矫正的方式来计算目标q值,进而对当前策略进行多方面的评估。

    4、进一步地,所述方法的具体步骤如下:

    5、步骤1:输入多种机器人控制任务的离线数据集,初始化目标q函数网络类、q函数协同网络、矫正网络、价值网络、策略重要性权重类、初始策略;

    6、步骤2:智能体从离线数据集中采样一批数据,并表示为四元组的形式;

    7、步骤3:利用q函数协同网络计算目标q值,利用价值网络预测q值的估计,进行策略评估;

    8、步骤4:根据当前策略的长期回报值对当前策略进行改进;

    9、步骤5:重复步骤2-步骤4,进行迭代训练,不断迭代策略评估与策略改进,直到策略收敛或达到预设的训练轮数。

    10、进一步地,所述步骤1中,离线数据集使用d4rl中的mujoco仿真环境自带的数据集,其中包括机器人奔跑在内的多种机器人控制任务;

    11、q函数网络类是用来近似动作价值函数q函数的多个网络,用于评估不同动作对机器人奔跑性能的影响;

    12、策略重要性权重类是在对策略进行评估的重要指标,包括奔跑速度、稳定性、步态对称性、跳跃性能、转弯性能、加速度、避障能力,由多个神经网络构成;

    13、初始策略是智能体开始学习时采用的策略,用于机器人初始奔跑的控制。

    14、进一步地,所述步骤2中,四元组的形式表示为(st,at,st+1,rt);st代表在t时刻的状态,包括机器人当前的姿态、速度、关节角度信息;at代表在t时刻智能体针对状态st选择的动作,包括关节扭矩、关节角度、步态模式、躯干扭转、步幅调整、步频调整、平衡控制;st+1代表环境在智能体在t时刻选择动作后,由st转变到的状态;rt代表智能体在t时刻选择动作后所得到的奖励。

    15、进一步地,所述步骤3中,策略评估的具体方法为:

    16、步骤3.1:利用多个q函数网络协同计算目标q值:

    17、

    18、其中,是每个子集上计算得出的目标q值,p=1,2,…;r(s,a)是在状态s下智能体选择动作a得到的奖励,γ是折扣因子,n={fi|i=1,2,…,k,k∈z+,k>1},fi是q函数网络;|mp|是集合mp的大小,表示mp中网络的个数;s′是下一时刻的状态,a′是下一时刻智能体选择的动作;πk表示初始策略经过k轮迭代训练得到的策略;

    19、步骤3.2:对步骤3.1的计算结果加权,再送到矫正网络,得到最终的目标q值:

    20、

    21、其中,qtarget(s,a)是通过矫正网络计算得到的最终目标q值,是将所有子集的目标q值放在一起得到的目标q值矩阵,是矫正网络的权重,b是矫正网络的偏差项;

    22、步骤3.3:利用值函数预测网络预测q值估计;

    23、步骤3.4:计算损失函数,使用目标q值与预测的q值估计计算贝尔曼均方误差;

    24、ed(π,fpredict)=ed[((fpredict-qtarget)(s,a))2]

    25、其中,ed(π,fpredict)是q值损失函数,ed[·]是计算期望,d代表数据集分布,fpredict是价值网络;

    26、步骤3.5:根据损失函数,通过adam优化算法更新价值网络函数,完成策略评估。

    27、进一步地,所述步骤4的具体方法为:

    28、步骤4.1:使用策略重要性权重和当前策略的价值与行为策略的价值的差的乘积计算出当前策略的长期回报值:

    29、ld(πk,fpredict)=ed[w(πk)fpredict(s,πk)-fbehavior(s,a)]

    30、其中,k表示第k轮训练,w(πk)是策略对应的重要性权重,d表示数据集分布,ed[·]是计算期望,fpredict(s,πk)是价值网络根据当前策略计算得到的价值,fbehavior(s,a)是行为策略的价值;

    31、步骤4.2:在众多策略中选择出长期回报最高的策略改进当前策略,更新策略网络,如下式:

    32、

    33、其中,π是所有策略的集合。

    34、进一步地,所述步骤4.1中,由于行为策略无法直接获得,使用离线数据集的经验分布代替行为策略。

    35、采用上述技术方案所产生的有益效果在于:本发明提供的基于策略重要性识别和值函数矫正的机器人奔跑控制方法,通过策略重要性权重和值函数矫正,智能体能够更有效地学习如何在不同地形和环境下以更高的速度奔跑,提高了机器人的运动效率;在离线数据集覆盖不充分的情况下,智能体在学习中采用的悲观估计和重要性加权方法,尽可能地避免了过于乐观的估计以及过度保守的策略,从而缓解了奖励稀疏以及低奖励区域的困扰,有助于智能体在奔跑过程中保持稳定,减少跌倒和失衡的风险,从而实现机器人更平稳的奔跑;利用多种动作类型和状态信息,智能体可以学习到更复杂和精细的步态控制策略,从而实现机器人更灵活和自然的奔跑步态,适应不同的任务需求;智能体通过在离线数据集上的学习,能够更好地适应不同的环境变化,如不同的地形、不平坦的表面和障碍物等,提高了机器人奔跑控制的鲁棒性;由于本发明提高了离线数据集的利用率,智能体能够在更短的时间内学习到有效的奔跑策略,减少了实际训练所需的时间和资源。本发明的方法使智能体能够处理更复杂的奔跑任务,如快速变速、急转弯和跳跃等,提高了机器人的整体任务执行能力。


    技术特征:

    1.一种基于策略重要性识别和值函数矫正的机器人奔跑控制方法,其特征在于:所述方法使用当前策略的值函数与行为策略的值函数的差代替选择策略的标准;采用策略重要性对策略进行加权评估,即面对不同的策略时,对每种策略进行动态评估,选取一个对长期回报最优的动作;采用q函数协同矫正的方式来计算目标q值,进而对当前策略进行多方面的评估。

    2.根据权利要求1所述的基于策略重要性识别和值函数矫正的机器人奔跑控制方法,其特征在于:所述方法的具体步骤如下:

    3.根据权利要求2所述的基于策略重要性识别和值函数矫正的机器人奔跑控制方法,其特征在于:所述步骤1中,离线数据集使用d4rl中的mujoco仿真环境自带的数据集,其中包括机器人奔跑在内的多种机器人控制任务;

    4.根据权利要求2所述的基于策略重要性识别和值函数矫正的机器人奔跑控制方法,其特征在于:所述步骤2中,四元组的形式表示为(st,at,st+1,rt);st代表在t时刻的状态,包括机器人当前的姿态、速度、关节角度信息;at代表在t时刻智能体针对状态st选择的动作,包括关节扭矩、关节角度、步态模式、躯干扭转、步幅调整、步频调整、平衡控制;st+1代表环境在智能体在t时刻选择动作后,由st转变到的状态;rt代表智能体在t时刻选择动作后所得到的奖励。

    5.根据权利要求2所述的基于策略重要性识别和值函数矫正的机器人奔跑控制方法,其特征在于:所述步骤3中,策略评估的具体方法为:

    6.根据权利要求5所述的基于策略重要性识别和值函数矫正的机器人奔跑控制方法,其特征在于:所述步骤4的具体方法为:

    7.根据权利要求6所述的基于策略重要性识别和值函数矫正的机器人奔跑控制方法,其特征在于:所述步骤4.1中,由于行为策略无法直接获得,使用离线数据集的经验分布代替行为策略。


    技术总结
    本发明提供一种基于策略重要性识别和值函数矫正的机器人奔跑控制方法,涉及机器人控制技术领域。本发明使用当前策略的值函数与行为策略的值函数的差代替选择策略的标准;采用策略重要性对策略进行加权评估,即面对不同的策略时,对每种策略进行动态评估,选取一个对长期回报最优的动作;采用Q函数协同矫正的方式来计算目标Q值,进而对当前策略进行多方面的评估。本发明的方法能有效缓解由OOD引起的高估问题,提高智能体在真实环境下的表现性能以及在新环境下的稳定性和鲁棒性,使智能体能够处理更复杂的机器人奔跑任务,如快速变速、急转弯和跳跃等,提高了机器人的整体任务执行能力。

    技术研发人员:于亚新,白彬沂,杨添,于之晟,司一廷
    受保护的技术使用者:东北大学
    技术研发日:
    技术公布日:2024/10/24
    转载请注明原文地址:https://symbian.8miu.com/read-48109.html

    最新回复(0)