本发明涉及路径规划方法,尤其涉及一种基于改进q学习算法的无人艇航迹规划方法。
背景技术:
1、航迹规划是水面无人艇(usv)实现自主安全航行的关键技术。航迹规划方面,现有方案多使用a星算法、人工势场法、蚁群算法等启发式算法,用于寻找最短最经济的航迹。随着强化学习的流行,q学习也常被用来规划航迹。
2、传统的航迹规划方法主要使用a星、人工势场法等启发式算法,这类方法更多是作为一个路径寻优方法,而无法结合实际海洋环境对浅水区、航路转向点等其他因素进行多目标优化考量,且上述启发式算法容易陷入局部最优解。传统q学习通过给智能体设置抵达目标点奖励、航行距离奖励和碰撞奖励来规划航迹,同样没有考虑海洋真实环境和实际航行的航路转向点要求。
技术实现思路
1、本发明公开了一种基于改进q学习算法的无人艇航迹规划方法,以克服上述技术问题。
2、为了实现上述目的,本发明的技术方案是:
3、一种基于改进q学习算法的无人艇航迹规划方法,包括如下步骤:
4、s1:建立水面自主航行器的运动数学模型;
5、s2:建立栅格化海图,获取目的地位置坐标、障碍物的位置坐标,栅格单元所处位置的水深;同时根据所述水面自主航行器的运动数学模型,获取本船位置坐标;
6、s3:根据本船位置坐标、目的地位置坐标、障碍物的位置坐标,栅格单元所处位置的水深,建立q学习算法的奖励函数,包括:用于考虑水面自主航行器在航行过程中的碰撞和能够到达目的地的碰撞与抵达奖励函数、用于考虑水面自主航行器航行路线水深的深水区浅水区奖励函数、用于考虑水面自主航行器航行过程中出现航路拐点的航路转向点奖励函数、用于考虑usv航行路线距离的最优路线奖励函数;
7、s4:根据所述本船的初始位置坐标、目的地位置坐标以及q学习算法的奖励函数,获取usv的最优路径,以实现对无人艇的航迹规划。
8、进一步的,所述q学习算法的奖励函数建立如下:
9、最终将奖励值进行组合得到总的奖励rtotal:
10、rtotal=g1+g2+g3+g4
11、式中:rtotal表示总的奖励函数;g1表示碰撞与抵达奖励函数;g2表示深水区浅水区奖励函数;g3表示航路转向点奖励函数;g4表示最优路线奖励函数。
12、进一步的,所述碰撞与抵达奖励函数获取如下:
13、
14、其中,p为抵达奖励系数;pit表示在第i次迭代的t时刻本船位置坐标,pdestination表示目的地位置坐标,为障碍物范围的位置坐标集合;t表示水面自主航行器行进时刻。
15、进一步的,所述深水区浅水区奖励函数获取如下:
16、
17、式中:rshallow表示用于描述usv行驶至浅水区的奖励系数;pit表示在第i次迭代的t时刻本船位置坐标,表示深水区的坐标集合,表示浅水区的坐标集合,pj表示栅格化海图中第j个栅格单元处的位置坐标,dpj表示在pj位置处的水深;j表示栅格化海图中的栅格单元的索引编号。
18、进一步的,所述航路转向点奖励函数获取如下:
19、
20、其中,ft表示t时刻usv的航行方向;ft-1表示t-1时刻usv的航行方向;rturn表示用于描述usv航行出现航路拐点的奖励值;tarrival表示usv抵达目标点的时刻。
21、进一步的,所述最优路线奖励函数获取如下:
22、
23、其中
24、
25、式中:ρ表示usv选取动作后行进的奖励系数。
26、进一步的,所述水面自主航行器的运动数学模型建立如下:
27、
28、其中,m表示船舶质量,δ表示舵角,xog为船舶重心在惯性坐标系中的纵坐标值,izz表示转动惯量;u,v,r分别表示前进速度,横漂速度和艏摇角速度;表示纵轴方向上关于前进速度u的时间导数的流体动力学导数;表示横轴方向上关于横漂速度v的时间导数的流体动力学导数;表示力矩关于横漂速度v的时间导数的流体动力学导数;表示横轴方向上关于艏摇角速度r的时间导数的流体动力学导数;表示绕竖直方向的外力矩关于艏摇角速度r的时间导数的流体动力学导数;表示前进速度u的导数的增量;xu表示纵轴方向上关于前进速度u的流体动力学导数;yv表示横轴方向上关于横漂速度v的流体动力学导数;nv表示绕竖直方向的外力矩关于横漂速度v的流体动力学导数;yr表示横轴方向上关于艏摇角速度r的流体动力学导数;△u表示前进速度u的增量;nr表示绕竖直方向的外力矩关于艏摇角速度r的流体动力学导数;yδ表示横轴方向上关于舵角δ的流体动力学导数;nδ表示绕竖直方向的外力矩关于舵角δ的流体动力学导数。
29、有益效果:本发明的一种基于改进q学习算法的无人艇航迹规划方法,通过建立栅格化海图,获取本船位置坐标、目的地位置坐标、障碍物的位置坐标,栅格单元所处位置的水深;能够最大程度的反映出海洋的真实环境,据此建立包括碰撞与抵达奖励函数、深水区浅水区奖励函数、航路转向点奖励函数和最优路线奖励函数的q学习算法的奖励函数,进而基于q学习算法获取usv的最优路径,以实现对无人艇的航迹规划。本发明旨在通过q学习算法综合考虑路径长短、深、浅水区、航路转向点等多因素要求,进行多目标优化,从而为usv进行真实海况下的航迹进行规划。
1.一种基于改进q学习算法的无人艇航迹规划方法,其特征在于,包括如下步骤:
2.根据权利要求1所述的一种基于改进q学习算法的无人艇航迹规划方法,其特征在于,所述q学习算法的奖励函数建立如下:
3.根据权利要求1所述的一种基于改进q学习算法的无人艇航迹规划方法,其特征在于,所述碰撞与抵达奖励函数获取如下:
4.根据权利要求1所述的一种基于改进q学习算法的无人艇航迹规划方法,其特征在于,所述深水区浅水区奖励函数获取如下:
5.根据权利要求1所述的一种基于改进q学习算法的无人艇航迹规划方法,其特征在于,所述航路转向点奖励函数获取如下:
6.根据权利要求1所述的一种基于改进q学习算法的无人艇航迹规划方法,其特征在于,所述最优路线奖励函数获取如下:
7.根据权利要求1所述的一种基于改进q学习算法的无人艇航迹规划方法,其特征在于,所述水面自主航行器的运动数学模型建立如下:
