本发明涉及道路交通流量监控,具体涉及一种基于空间划分和静态加权的交通流量预测方法。
背景技术:
1、由于城市路网复杂度高、车流量变化随机性强、流量数据中异常点较多等问题,实现准确的交通流量预测十分困难。
2、目前可用于交通流量预测的技术方法包括基于统计学的预测方法、基于传统机器学习模型的预测方法和基于深度学习模型的预测方法,但均存在一些问题,主要表现在:
3、a)基于统计学的预测方法使用历史交通数据的统计规律进行预测,通过计算历史数据的平均值或加权平均值来预测未来的交通流量,或通过分析历史数据随时间变化的规律建立数学模型来预测未来的交通流量。这类方法的计算成本低且部署方式简单,但对异常数据敏感且在数据分布较为复杂的情况下预测精度较差。
4、b)基于传统机器学习模型的预测方法使用参数量较小的模型来学习观测信息特征到交通流量特征的函数映射关系或拟合交通流量的变化模式,典型的传统机器学习模型包括线性回归模型、支持向量机回归模型、决策树回归模型等。基于传统机器学习模型的预测方法对交通流量数据的数据量要求较低,但是通常难以捕捉较为复杂的流量变化模式且对异常样本比较敏感。
5、c)基于深度学习模型的预测是近年来在交通流量预测中广泛应用的一类方法,能够自动从数据中提取高级特征并进行预测,通过构建多层感知机、卷积神经网络或循环神经网络等复杂的模型并在交通流量数据上进行训练,使得模型能够学习到流量变化的规律并实现预测。基于深度学习模型的预测方法高度依赖训练数据的质量和训练过程的有效性,而由于交通流量数据往往存在样本分布不均衡、低质量样本多且普遍存在异常样本等问题,采用常规技术训练的深度学习模型预测性能偏低,难以的实际应用中准确地预测道路流量。
技术实现思路
1、本发明的目的是为了解决现有技术中的上述缺陷,提供一种基于空间划分和静态加权的交通流量预测方法。
2、本发明的目的可以通过采取如下技术方案达到:
3、一种基于空间划分和静态加权的交通流量预测方法,所述交通流量预测方法包括如下步骤:
4、s1、使用交通流量历史观测数据进行基于交通观测信息特征的空间划分,形成一个数据子空间的集合,将交通流量历史观测数据中所有时刻的观测记录数据映射到不同时刻相应的数据子空间中;
5、s2、计算每个数据子空间的观测信息特征标准差,统计所有非空数据子空间的平均观测信息特征标准差,根据所有时刻的观测记录和数据子空间的隶属关系计算出交通流量历史数据中各个时刻观测记录的特异性度量;
6、s3、计算每个数据子空间的交通流量特征标准差,根据所有时刻的观测记录和数据子空间的隶属关系计算出交通流量历史数据中各个时刻观测记录的离群性度量;
7、s4、遍历交通流量历史数据中的所有观测记录,根据各个时刻观测记录的特异性度量和离群性度量计算各个时刻观测记录的价值权重,以数组的形式保存观测记录索引得到观测记录价值权重的映射关系;
8、s5、使用交通流量历史观测数据和各个时刻观测记录的价值权重数组训练长短期记忆神经网络模型,利用经过训练的长短期记忆神经网络模型预测交通流量。
9、进一步地,所述步骤s1的实现过程如下:
10、s11、对于交通流量历史观测数据,定义为所有观测记录数据的集合,其中表示第个观测记录,,分别为第个观测记录的时间戳、观测信息特征向量、交通流量特征,为交通流量历史观测数据的大小;时间戳提供了观测记录之间的时序信息,观测信息特征向量提供了与交通流量密切相关的道路状况信息,交通流量特征为预测目标。
11、s12、定义观测信息特征向量,其中为第个观测记录的第个观测信息特征,,为观测信息特征的数量;根据预先设定的划分参数将每个观测信息特征在数据集中的取值范围均匀划分为个区间,为大于1的正整数,得到总共个数据子空间;定义为第个数据子空间在第维观测信息特征上的区间索引,,定义第个数据子空间的标识为,其中表示拼接操作;预先设定的划分参数的取值范围一般为[2, 20],的数值控制了数据子空间的大小,进而可以决定在可控的邻域范围内对观测记录的统计学分布特性进行分析。
12、s13、对于第个观测记录的第维观测信息特征,通过公式计算第个观测记录在第维观测信息特征上的区间索引,为第维观测信息特征的最大值,为第个观测信息特征的最小值;基于划分参数计算观测记录在各个观测信息特征上的区间索引是一种线性复杂度的操作,即计算复杂度与观测记录数量、观测特征信息维度数量成线性关系,因此具有效率高的优点。
13、s14、遍历交通流量历史观测数据,对于每一条观测记录,通过公式计算所在数据子空间的第维索引并进行拼接得到数据子空间,将观测记录映射到以为标识的数据子空间中,建立观测记录和所处数据子空间之间一一映射的双向索引,通过该双向索引,给定数据子空间可映射得出所容纳的所有观测记录。观测记录到数据子空间的映射用数组实现,即使用哈希函数将观测记录的时间戳映射为索引并在索引指向的数组元素存储数据子空间的索引;数据子空间到所容纳的所有观测记录的映射用对象列表实现,其中每个对象对应一个数据子空间并存储所容纳的所有观测记录的索引。所述实现方式使得遍历一次交通流量历史观测数据就能完成空间划分并建立观测记录和数据子空间之间的双向索引。
14、进一步地,所述步骤s2的实现过程如下:
15、s21、对于每一个数据子空间,,通过公式计算数据子空间的观测信息特征标准差,其中为数据子空间内的观测记录数量,为数据子空间内所有样本的观测信息特征向量平均值,表示向量二范数的平方,表示数据子空间内的观测记录,和分别表示观测记录的观测信息特征向量和交通流量特征;观测信息特征标准差的计算公式能够处理一维和多维观测信息特征,从而能准确刻画任意维度数据子空间中观测记录之间的相似程度;当仅有一维观测信息特征时,表示观测信息特征与观测信息特征平均值之差的平方,当有多维观测信息特征时,表示观测信息特征向量与观测信息特征向量向量平均值的欧式距离之平方。
16、s22、通过公式计算所有非空数据子空间的多维观测信息特征标准差的平均值;多维观测信息特征标准差的平均值反映了整个交通流量历史观测数据的分布均匀程度,排除空的数据子空间能够规避观测信息特征的无效取值区域。
17、s23、对于每一个数据子空间,,通过公式计算得到对应的子空间特异性度量;对于每一个观测记录通过公式计算的特异性度量,其中为指示函数,当观测记录隶属于数据子空间时取1,否则取0。此步骤中计算得到的子空间特异性度量被赋予对应数据子空间内的所有观测记录,同时每一个观测记录的特异性度量仅与所在的数据子空间有关,由此能够以很低的计算复杂度衡量各个观测记录是否具备相对特殊的观测信息特征。
18、进一步地,所述步骤s3的实现过程如下:
19、s31、对于每一个数据子空间,,通过公式计算数据子空间的交通流量特征标准差,其中为数据子空间内的观测记录数量,为数据子空间内所有观测记录的交通流量特征平均值,表示向量二范数的平方,表示数据子空间内的观测记录,和分别表示观测记录的观测信息特征向量和交通流量特征;数据子空间的交通流量特征标准差反映一个数据子空间内所有观测记录的交通流量特征偏离平均值的总体情况,该步骤中计算方式中采用向量二范数扩展了统计学中的标准差定义,因此可适配多维交通流量特征的预测。
20、s32、对于每一个观测记录,,通过公式计算的离群性度量,其中为指示函数,为范数算法参数,表示对-范数取次方。该步骤中观测记录的离群性度量在考虑交通流量特征和交通流量特征平均值之间的绝对距离的基础上,同时考虑了数据子空间内观测记录的交通流量特征偏离平均值的总体情况,从而科学量化每个观测记录的交通流量特征取值异常的风险。
21、进一步地,所述步骤s4的实现过程如下:
22、s41、 对于每一个观测记录 ,,定义重要性函数,其中观测信息特征向量和交通流量特征代入重要性函数的计算结果为观测记录的价值权重;重要性函数综合特异性度量和离群性度量量化了各个观测记录的学习价值,高价值的观测记录被赋予更大的权重以提升预测模型训练的有效性。
23、s42、遍历交通流量历史观测数据,利用重要性函数计算所有观测记录数据的价值权重并以数组的形式持久化存储,其中为重要性函数。持久化存储所有观测记录数据的价值权重使得预测模型训练过程中可以采用静态加权技术对梯度进行缩放,避免二次计算的开销。
24、进一步地,所述步骤s5的实现过程如下:
25、s51、初始化一个长短期记忆神经网络模型,的待训练参数记为,长短期记忆神经网络模型的输入是交通流量历史观测数据的信息特征向量,长短期记忆神经网络模型的输出是交通流量的预测值;长短期记忆神经网络模型能够有效提取观测记录构成的序列信息,从而利用多个时刻的观测信息特征准确预测下一时刻的交通流量。
26、s52、从交通流量历史观测数据中随机抽取一批观测记录,包括条记录条数,根据该批观测记录的索引从观测记录数据的价值权重数组中取出相应元素并构造对角矩阵,为索引的观测记录对应的价值权重;将该批观测记录输入长短期记忆神经网络模型并采集其输出的交通流量预测值,为索引的观测记录对应的交通流量预测值,使用损失函数分别计算索引的观测记录关于长短期记忆神经网络模型参数的梯度,并排列成列向量的形式,,为索引的观测记录对应的交通流量实际值,将价值权重对角矩阵左乘梯度列向量得到加权梯度,对加权梯度求平均值,利用基于梯度的优化算法和加权梯度平均值对长短期记忆神经网络模型的参数进行更新;此步骤采用的基于矩阵-向量乘法的梯度加权方法能够有效利用编程框架的现有算子、编译器的算子优化和底层硬件加速技术实现高效的加权运算。
27、s53、重复执行步骤s52直到参数迭代更新次数达到预先设定的上限;
28、s54、将历史时刻0至的交通观测信息特征向量和当前时刻的交通观测信息特征向量依次输入长短期记忆神经网络模型中,计算长短期记忆神经网络模型的输出,得到下一时刻的交通流量预测值。此步骤中历史时刻的交通观测信息特征在长短期记忆神经网络模型中被隐式地表达为隐含状态,使得对下一时刻的交通流量预测能够利用丰富的历史信息。
29、进一步地,所述观测信息特征包括道路流量信息、平均车速、平均车道占用率、拥塞程度、停放车辆数在内的一种或多种。每一种观测信息特征反映了影响交通流量的一种客观因素,本方法适用于包含一种或多种观测信息特征的场景。
30、进一步地,所述损失函数为均方差损失函数或huber损失函数,其中为阈值参数。此步骤扩展了均方差损失函数和huber损失函数的定义,因此可适用一维和多维交通流量特征的情况。
31、进一步地,所述第个数据子空间的标识为,其中表示拼接操作,为第个数据子空间在第维观测信息特征上的区间索引;数据子空间定义了一个确定边界的邻域,该邻域中的任一观测记录符合条件
32、
33、,其中为第维观测信息特征的最大值,为第个观测信息特征的最小值;利用数据子空间的定义能够经一次数据遍历就快速确定所有观测记录所处的邻域,计算成本低。
34、进一步地,所述长短期记忆神经网络模型包含一个或多个隐含层,隐含层的待训练参数是整个长短期记忆神经网络模型待训练参数的子集,其中每个隐含层进行如下计算:,,,,,,其中、、、分别为第时刻输入门、遗忘门、cell门和输出门的输出,为第时刻的cell状态,为第时刻的隐含状态,为来自输入层或上一个隐含层的输出,、分别为sigmoid函数和双曲正切函数,、、、分别为输入门、遗忘门、cell门和输出门的输入变换参数,、、、分别为输入门、遗忘门、cell门和输出门的隐含状态变换参数,、、、分别为输入门、遗忘门、cell门和输出门的输入偏置参数,、、、分别为输入门、遗忘门、cell门和输出门的隐含状态偏置参数,表示hadamard积。长短期记忆神经网络模型的隐含层采用的门控机制能够有效保留不同时间跨度的信息,结合观测记录数据的价值权重能够准确地学习交通流量的变化模式。
35、进一步地,长短期记忆神经网络模型的参数采用随机梯度下降算法或adam算法进行更新,其中,随机梯度下降算法更新规则为,为预先设定的学习率参数;其中,adam算法更新规则为, 为偏差修正的一阶矩估计,为偏差修正的二阶原始矩估计,有偏一阶矩估计的初始值为0,更新公式为,有偏二阶矩原始估计的初始值为0,更新公式为,为一阶矩估计衰减率参数、为二阶矩估计衰减率参数、为实现数值稳定性的参数,、分别为、的t次方。随机梯度下降算法和adam算法均以梯度为基础对模型参数做更新,利用步骤s52中梯度加权技术能够提升这两种算法对长短期记忆神经网络模型参数进行更新的有效性。
36、本发明相对于现有技术具有如下的优点及效果:
37、(1)本发明采用预处理的方式完成交通流量数据的分析和价值权重计算,结合长短期记忆神经网络模型可有效提升对交通流量的预测准确性,且几乎不增加模型训练的时间开销。
38、(2)本发明可以快速地对交通流量数据进行空间划分并在数据子空间内科学地刻画每条观测记录的特异性和离群性程度,从而量化每条观测记录的价值并帮助长短期记忆神经网络模型准确地学习交通流量的变化模式。
39、(3)本发明结合交通观测信息特征和交通流量特征对数据进行差异化加权能够有效避免或降低无效数据、低质量数据和异常数据的负面影响,降低长短期记忆神经网络模型对交通流量的预测误差,实现低成本且准确的交通流量预测。
1.一种基于空间划分和静态加权的交通流量预测方法,其特征在于,所述交通流量预测方法包括如下步骤:
2.根据权利要求1所述的基于空间划分和静态加权的交通流量预测方法,其特征在于,所述步骤s1的实现过程如下:
3.根据权利要求1所述的基于空间划分和静态加权的交通流量预测方法,其特征在于,所述步骤s2的实现过程如下:
4.根据权利要求1所述的基于空间划分和静态加权的交通流量预测方法,其特征在于,所述步骤s3的实现过程如下:
5.根据权利要求1所述的基于空间划分和静态加权的交通流量预测方法,其特征在于,所述步骤s4的实现过程如下:
6.根据权利要求1所述的基于空间划分和静态加权的交通流量预测方法,其特征在于,所述步骤s5的实现过程如下:
7.根据权利要求6所述的基于空间划分和静态加权的交通流量预测方法,其特征在于,所述损失函数为均方差损失函数或huber损失函数。
8.根据权利要求2所述的基于空间划分和静态加权的交通流量预测方法,其特征在于,第个数据子空间的标识为,其中表示拼接操作,为第个数据子空间在第维观测信息特征上的区间索引;数据子空间定义了一个确定边界的邻域,该邻域中的任一观测记录符合条件
9.根据权利要求6所述的基于空间划分和静态加权的交通流量预测方法,其特征在于,长短期记忆神经网络模型包含一个或多个隐含层,隐含层的待训练参数是整个长短期记忆神经网络模型待训练参数的子集,其中每个隐含层进行如下计算:,,,,,,其中、、、分别为第时刻输入门、遗忘门、cell门和输出门的输出,为第时刻的cell状态,为第时刻的隐含状态,为来自输入层或上一个隐含层的输出,、分别为sigmoid函数和双曲正切函数,、、、分别为输入门、遗忘门、cell门和输出门的输入变换参数,、、、分别为输入门、遗忘门、cell门和输出门的隐含状态变换参数,、、、分别为输入门、遗忘门、cell门和输出门的输入偏置参数,、、、分别为输入门、遗忘门、cell门和输出门的隐含状态偏置参数,表示hadamard积。
10.根据权利要求6所述的基于空间划分和静态加权的交通流量预测方法,其特征在于,长短期记忆神经网络模型的参数采用随机梯度下降算法或adam算法进行更新,其中,随机梯度下降算法更新规则为,为预先设定的学习率参数;其中,adam算法更新规则为,为偏差修正的一阶矩估计,为偏差修正的二阶原始矩估计,有偏一阶矩估计的初始值为0,更新公式为,有偏二阶矩原始估计z的初始值为0,更新公式为,为一阶矩估计衰减率参数、为二阶矩估计衰减率参数、为实现数值稳定性的参数,、分别为、的t次方。
