随着城市化进程的快速推进,城市道路网络日益复杂,交通拥堵问题愈发突出。相关统计数据表明,中国城市交通拥堵造成的年均经济损失已达1 600亿元,且这一数值仍呈上升态势[1]。为缓解城市交通拥堵及其带来的经济损失,提升城市道路交通状况与通行能力成为迫切需求。实时监测城市道路的交通流量并预测未来相关数据,可为交通管理部门提供决策依据。基于此,管理部门能够及时采取疏导措施,有效缓解交通拥堵、提升通行效率,最终实现基础设施优化和降低经济损失。
交通流量数据具有高维度、非线性和异构性等特征,涵盖速度、密度等多维度变量[2]。虽然已有研究利用支持向量机(support vector machine,SVM)[3]和K-最近邻算法(K-nearest neighbor,KNN)[4]等机器学习方法实现了交通流量预测,但是预测的精度受限。深度学习技术的兴起为该领域带来新突破,其中图卷积网络(graph convolution network,GCN)[5]的出现使得卷积操作得以适配路网拓扑结构。Li等[6]提出的DCRNN将交通网络数据的输入输出关系建模为一种扩散过程,利用双向随机游走算法来捕捉时空依赖分布;Yu等[7]提出的STGCN模型,结合了时序卷积网络和图卷积网络,实现了路网时空相关性的联合建模。然而,这类方法在动态相关性捕捉和多周期模式识别方面仍存在局限。因此,Guo等[8]提出了一种基于注意力的时空图卷积网络(attention based spatial-temporal graph convolutional network,ASTGCN),通过设计近期交通流、日周期性、周周期性3个独立组件,结合时空注意力机制实现了动态特征的有效捕获;Zheng等[9]进一步提出GMAN模型,采用编码器-解码器架构用于建模时空因素的影响,在模拟动态相关性的同时缓解了误差传播问题,提升了长期预测性能。
上述方法捕获空间相关性主要依赖预定义的静态图结构,但此类结构不足以表征复杂的交通网络。针对这一问题,Zhang等[10]提出了AdapGL算法,通过多种空间学习视角生成适应性的图结构,该算法通过使用四组可学习参数,在图卷积操作中获取最优依赖图的表示形式。Wu等[11]和Bai等[12]则通过可学习二维邻接矩阵对复杂道路网络进行建模。然而,这些方法主要依赖可学习参数生成道路网络结构,而未充分考虑节点特征的影响,这在数据规模较小或稀疏时限制了模型性能的进一步优化。Lin等[13]提出的DCGCN虽然引入了动态因果图结构以捕捉交通流节点中的因果关系,但未显式融合节点特征信息,对节点自身特征的利用相对较弱。在交通流量预测中,节点特征能够反映道路交通状况的变化,在生成邻域图结构时具有更高的有效性。基于上述分析,本文提出了一种面向交通流量预测的自适应时空图卷积网络模型(adaptive spatial-temporal graph convolutional network for traffic forecasting,AdpSTGCN),该模型基于节点属性特征推导出最优图结构,能够动态捕捉时空耦合的复杂空间关系,实现对道路网络拓扑结构的动态表征,进而对未来交通状况进行精准预测。
交通流量预测是指根据历史交通流量数据,采用某种预测模型或算法对其进行训练或分析,从而预测未来一段时间的交通流量信息。本文将道路网络表示为加权有向图G=(V,E,A)。其中,V表示道路网络中传感器的节点集合,节点数量|V|=N;E表示节点之间的边集合,反映了节点间连接的权重;A∈RN×N是一个加权邻接矩阵,表示任意一对节点之间的关联程度。在t时刻,图G上的交通历史记录表示为一个图信号Xt∈RN×F,其中,F表示每个节点属性的维度。交通预测问题旨在学习一个函数f,该函数能够根据S个历史图信号X=[X(t-S+1),…,Xt]∈RS×N×F和交通网络的A∈RN×N的情况下,预测未来T个时间步的图信号
即![]()
AdpSTGCN模型框架如图1所示。该框架由一个自适应图结构学习组件和一个多步交通状况预测组件构成。自适应图结构学习组件旨在自动学习图结构,通过综合考虑图中所有节点的历史信息,以数据驱动的方式生成最优图邻接矩阵。多步交通状况组件旨在预测多步交通状况,它堆叠了多个时空层(ST-Layers),并基于学习到的图邻接矩阵进行预测以提高性能。在每个时空层中,首先通过门控时间卷积(gate temporal convolution,GTCN)模块来提取全局时间特征,以增强模型的时序建模能力。随后,通过图扩散卷积循环单元(graph diffusion convolution recurrent unit,GDCRU)模块进一步提取全局空间特征,并捕捉局部时间依赖性。通过跳跃连接(skip connection)融合多个堆叠时空块(ST-Blocks)中不同时空层的特征,AdpSTGCN能够从不同维度综合考虑时空特征,从而精准地预测交通流量。AdpSTGCN的学习过程为
A*=g(X,A);
(1)
(2)
图1 AdpSTGCN模型框架
Figure 1 AdpSTGCN model framework
式中:g(X,A)用于自适应学习图结构,该函数以节点属性X和邻接矩阵A作为输入,生成学习到的最优图结构A*;h(X,A*)基于学习到的图结构A*进行多步交通状况预测,并输出最终的预测结果![]()
图2展示了自适应图结构学习框架。传统方法依赖单一可学习矩阵拟合路网结构,但忽略了节点属性变化在道路结构学习中的作用,导致静态图在小样本或稀疏数据场景下难以优化的问题。为此,本文构建了一种自适应图结构学习组件,以数据驱动的方式获得最优图邻接矩阵。具体而言,图结构学习分为全局图结构学习和局部图结构学习两部分。全局图结构变化较为缓慢,因为从长期视角看,交通网络整体上相对稳定[14]。然而,交通网络可能因外部因素(如局部地区的极端天气或短期的交通事故)而发生局部变化。因此,构建的模型需要从全局和局部视角自适应地推断图结构。
图2 自适应图结构学习框架
Figure 2 Adaptive graph structure learning framework
1.3.1 全局图结构学习
从全局视角来看,节点之间的依赖关系相对稳定。传统的预定义邻接矩阵通常通过欧氏距离来衡量节点之间的关系。然而,欧氏距离难以准确反映实际的道路拓扑结构[15]。因此,本文采用全局学习的视角来学习交通网络。为了更精准地捕捉交通网络中节点间复杂的空间依赖关系,本文使用两个可训练向量E1、E2∈RN×k来表示空间依赖关系,其中k为隐藏维度,用于减少参数数量。两个可训练向量能够从不同维度对交通流量节点特征进行编码,一个向量可以侧重于节点的地理位置特征,另一个向量可以关注节点周边的交通流量模式、区域功能等特征,从而更全面地捕捉节点之间的空间依赖关系。在训练过程中,考虑到交通网络原始预定义邻接矩阵直接优化难度大[16],同时为保留原始图中的有效信息,原始预定义邻接矩阵借助残差连接并通过更新ψ来进行调整优化。
(3)
AGL=ψ+A。
(4)
式中:E1为源节点的嵌入向量;E2为目标节点的嵌入向量,通过点积操作计算源节点和目标节点之间的空间依赖权重;ReLU用于消除节点之间的弱连接;函数σ(·)为softmax函数,用于对全局信息邻接矩阵进行归一化处理。
1.3.2 局部图结构学习
从局部视角来看,当遇到交通事件时(如高峰时段、天气状况或交通事故),静态路网中的空间关系可能发生显著变化。由于节点与记录交通状况的属性相关联,本研究通过挖掘节点属性中的相关信息来描述这些突发波动。对于给定的节点属性X∈RS×N×F,首先通过全连接网络将属性维度从F扩展到D,公式如下:
H=FC(X)∈RS×N×D。
(5)
式中:H表示转换后的节点属性。随后,为捕捉短期时间段S内交通流序列的临时空间关系,采用时间维度卷积聚合转换后输入H的节点特征,其公式如下:
(6)
式中:卷积核K∈RP用于在时间维度上聚合特征,进而完成交通流序列的卷积处理;n表示节点索引;d表示特征维度索引;p表示时间维度索引;Mi表示通过对节点i在所有时间维度上的属性进行聚合后得到的值。
完成时间维度上的聚合后,本文设计了一种度量学习方法,通过学习一对节点表示的度量函数φ(·,·)来推导节点之间的学习关系,其公式如下:
(7)
式中:
表示节点i和节点j之间的学习关系。由于采用节点操作来表示节点间的接近性,该度量学习函数可以简化为矩阵乘法形式:
ALoc=M·MT。
(8)
1.3.3 多层级图结构融合
在完成全局和局部图结构学习后,需要将这两部分的图结构信息进行融合,以构建一个能够全面反映交通网络空间依赖关系的最优图邻接矩阵,用于后续的多步交通流量预测任务。本文通过使用ReLU激活函数对两个邻接矩阵求和,然后归一化可得到最优的图结构,公式如下:
A*=Norm(ReLU(AGL+ALoc))。
(9)
针对交通状况中复杂的时空关性,本文设计了一种时空图卷积网络来预测未来的多步交通状况。具体而言,设计了图扩散卷积循环单元(GDCRU)模块,旨在精准捕捉全局空间相关性与局部时间依赖性。其核心思路是将双向图扩散卷积嵌入门控循环单元架构中[17]。在每个循环单元里,图扩散卷积能够处理来自上一循环单元输出的过往空间特征以及当前交通状况中的空间相关信息,以此强化空间信息的挖掘与整合能力。与此同时,借助门控循环单元自身的特性,该模块亦能够敏锐地捕捉局部时间维度上的依赖关系,进而实现对交通数据时空特性更为细致与准确的表征与建模。为了进一步捕获全局时间相关性,本文设计了GTCN模块。在门控时间卷积模块中,采用了扩张时域因果卷积[18](dilated temporal causal convolution,DTCC),这种卷积方式通过引入扩张因子,巧妙地扩大了卷积的感受野,使得模型能够在不增加过多计算量的情况下,跨越更广泛的时间区间去捕捉数据中的时间依赖特征。
1.4.1 图扩散卷积循环单元
DCRNN[6]是一种探究节点表示的图卷积方法,其提出的双向扩散卷积能有效捕捉上下游交通的影响。本文将交通状态的变化建模为有向图上的信号扩散过程,并采用图扩散卷积来提取空间特征。其公式如下:
(10)
Pf=A/rowsum(A);
(11)
Pb=AT/rowsum(AT)。
(12)
式中:Pf和Pb分别为前向与后向传递矩阵;K为扩散步数;Wk1和Wk2为可训练参数。通过自适应图结构学习组件可以获得最优图结构A*后,图扩散卷积层将在最优图结构上进行学习。具体方法是在式(10)中将P替换为A*,本文定义基于A*的图扩散卷积层表示为![]()
本文采用基于RNN的模型来捕获时间相关性。门控循环单元(gated recurrent unit,GRU)通过较少的参数有效解决梯度消失问题,并能够捕获长时间序列的依赖关系。为了同时捕获全局空间相关性和局部时间的依赖关系,本文将GRU中的矩阵乘法替换为图扩散卷积,并将其命名为图扩散卷积循环单元(graph diffusion convolution recurrent unit,GDCRU)。其公式如下所示:
(13)
(14)
(15)
Ht=ut⊙Ht-1+(1-ut)⊙Ct。
(16)
式中:Xt为t时刻的输入特征;Ht-1表示(t-1)时刻从GDCRU输出的隐藏状态;rt和ut分别为t时刻的重置门和更新门;
为扩散卷积层的可学习参数。图扩散卷积循环单元(GDCRU)将图扩散卷积捕获的空间相关性与门控循环单元(GRU)建模的时间相关性相结合,实现了交通数据中空间与时间相关性的同时学习,从而增强模型捕捉节点间依赖关系的能力。
1.4.2 门控时间卷积
扩张时域因果卷积(DTCC)是一种改进的卷积操作,通过引入扩张因子(dilation factor),显著扩大了网络的时间感受野,使输出仅依赖于当前及历史时间步的数据,而不包含未来信息。扩张时域因果卷积的公式为
(17)
式中:x∈RT表示时间序列;g表示扩张因子;*表示卷积运算符。通过逐步增加扩张因子g,模型在时间域上的感受野呈指数增长,使得模型能够堆叠较少的因果卷积层来捕获全局时间序列的信息。
为了更有效地探索全局时间相关性,本文借鉴了Kong等[19]之前的工作,设计了一个门控时间卷积模块(GTCN)。该模块结合门控机制和扩张时域因果卷积,旨在高效地捕获复杂的全局时间相关性,并能处理长期依赖问题,其结构如图3所示。GTCN的每一层包含两个参数设置相同的扩张时域因果卷积。为了确保足够的时间窗口,本文在第i层中设置扩张因子为2i-1。这种设计使感受野随网络层数的增加呈指数级增长,从而有效捕获时间序列中的全局时间相关性。GTCN的公式如下:
gated=σ(f*X+b);
(18)
GTCN(X)=gated⊗(g*X+c)+
(1-gated)⊗(h*X+g)。
(19)
图3 GTCN模块结构
Figure 3 Structure of GTCN module
1.4.3 多步预测的输出层
不同于以往的编码器-解码器模型,其下一步的预测依赖于前一步的预测结果,本研究通过输出层直接获取所有节点在未来T个时间步的交通状态预测结果,具体如下:
(20)
式中:ZS表示通过跳跃连接沿特征维度堆叠各ST-Layer融合后的特征;ReLU(·)表示非线性激活层;MLP(·)表示多层感知机。
在模型训练的过程中,与现有的研究一致,采用平均绝对误差作为训练目标,并对多步预测任务的损失进行优化。AdpSTGCN的多步交通预测损失函数定义如下:
(21)
式中:Yi,j,k为真实值;
为第i个时间步所有节点的预测值。
在训练过程中,AdpSTGCN模型的所有参数均可以通过梯度下降进行优化,然而,模型包含大量可学习参数且训练数据较为稀疏,采用传统的端到端的训练方式可能导致模型训练不充分,进而影响性能表现[20]。
为了解决上述问题,本文采用了递进式训练方法来优化模型训练过程。首先,将全局层级图结构学习模块与交通状态预测组件相结合,进行预训练AGL,公式如下所示:
(22)
此预训练策略为AGL提供了良好的初始化,从而使AdpSTGCN更易于收敛。接着,通过式(9)将预训练的ALoc与AGL相结合,并通过式(1)和式(2)以及损失函数式(21)对AdpSTGCN进行训练。递进式训练如算法1所示。
算法1 AdpSTGCN的递进式训练算法。
输入:训练集Dtrain、邻接矩阵A∈RN×N;
输出:训练后的AdpSTGCN模型。
① 初始化模型的所有参数;
② 重复执行以下步骤(步骤③~⑧);
③ 从训练集Dtrain中随机选取一个批次{X,Y};
④ 使用式(4)更新AGL←ψ+A;
⑤ 使用式(22)计算预测值![]()
⑥ 使用式(21)计算损失函数![]()
⑦ 更新参数θ1←θ1-α1
θ1L;
⑧ 更新邻接矩阵AGL←AGL-α1
AGLL;
⑨ 直到满足停止准则;
⑩ 重复执行以下步骤(步骤
-
);
从训练集Dtrain中随机选取一个批次{X,Y};
使用式(9)生成A*←FUSE(AGL,ALoc);
使用式(2)计算预测值![]()
使用式(21)计算损失函数![]()
更新参数θ1←θ1-α1
θ1L;
更新参数θ2←θ2-α2
θ2L;
直到满足停止准则;
输出训练后的AdpSTGCN模型。
设θ1表示多步交通状态预测组件中的可训练参数,θ2表示自适应图结构学习组件中的可训练参数,它们的梯度分别为
θ1L和
θ2L。设α1为初始阶段的学习率,β1和β2为后续阶段的学习率。如算法1所示,训练集和预定义的邻接矩阵作为输入,然后通过迭代全局层级图结构,直至收敛。最后通过梯度下降更新整个模型,直至满足停止准则。
本文在两个真实交通流量数据集上对 AdpSTGCN 模型的性能进行了评估。
(1)METR-La:该数据集涵盖2012年3月1日至6月30日洛杉矶高速公路的交通流量数据,包含207个传感器节点,记录时长达4个月。
(2)PEMS-Bay:该数据集收集了2017年1月1日至6月30日旧金山湾区的交通速度数据,涉及 325个传感器节点,覆盖时长为6个月。
本文对两个数据集的交通流量时间序列进行处理:将采样间隔统一调整每条数据为5 min,按7∶1∶2 的比例划分为训练集、验证集和测试集,并对划分后的数据实施归一化处理。数据集的详细信息如表1所示。
表1 数据集详细信息
Table 1 Dataset details
数据集节点数量步长间隔/min目标特征METR-La20734 2725 交通流量PEMS-Bay32552 1165 交通流量
实验使用了误差指标来评估模型,分别为平均绝对误差(MAE)、均方根误差(RMSE)和平均绝对百分比误差(MAPE)作为实验的评价指标。评估指标的定义如下:
(23)
(24)
(25)
式中:yi为真实值;
为预测值;n为测试样本的数量。MAE、RMSE、MAPE反映了预测值与真实值之间的差异,当MAE、RMSE、MAPE值越小,表明预测模型的性能越好。
本文选择HA[21]、ARIMA[22]、FC-LSTM[23] 、DCRNN[6]、STGCN[7]、Graph WaveNet[11]、GMAN[9]、DMSTGCN[24]、PGCN[25]等9种同样可以用于交通流量预测领域的模型作为基准方法进行对比实验。
本实验采用CUDA 11.0深度学习框架和CuDNN网络加速库,并基于PyTorch 1.12.0框架实现。所有实验均在配备GRID T4-8Q(8 GB显存)GPU,QEMU Virtual CPU(内存32 GB)的计算平台上运行。实验使用过去1 h的交通速度来预测未来1 h的交通速度,即S=T=12。为了进行时空特征学习,本文堆叠了4个ST-Blocks,每个ST-Block包含两个ST-Layer。为了将整个输入序列都考虑在内,本文将第一个时空层中GTCN模块的扩张因子设定为1,第二个时空层中GTCN模块的扩张因子设定为2。训练中,实验数据的批处理大小为32,轮次epoch设置为100,使用学习率为0.001的Adam优化器进行实验优化。
表2展示了AdpSTGCN模型与基准模型在两个数据集上对未来15,30和60 min的预测性能。实验结果表明,AdpSTGCN在两个数据集上的评估指标均优于现有基线模型。
表2 不同模型在METR-La和PEMS-Bay数据集上的预测性能
Table 2 Prediction performance of different models on the METR-La and PEMS-Bay datasets
数据集模型15 min30 min60 minMAERMSEMAPE/%MAERMSEMAPE/%MAERMSEMAPE/%METR-LaPEMS-BayHA4.167.8013.004.167.8013.004.167.8013.00ARIMA3.998.219.605.1510.4512.706.9013.2317.40FC-LSTM3.446.309.603.777.2310.904.378.6914.00DCRNN2.775.387.303.156.458.803.607.6010.50STGCN2.885.747.623.477.249.574.599.4012.70Graph WaveNet2.695.156.903.076.228.373.537.3710.01GMAN2.775.487.253.086.348.433.447.359.87DMSTGCN2.855.547.543.266.569.193.727.5510.96PGCN2.705.166.983.086.228.383.547.369.94AdpSTGCN2.645.046.763.016.018.173.427.089.83HA2.885.596.802.885.596.802.885.596.80ARIMA1.623.303.502.334.765.403.386.508.30FC-LSTM2.054.194.802.204.555.202.374.965.70DCRNN1.382.952.901.743.973.902.074.474.90STGCN1.362.962.901.814.274.172.495.695.79Graph WaveNet1.302.742.731.633.703.671.954.524.63GMAN1.342.912.861.633.763.681.864.464.37DMSTGCN1.332.832.801.673.793.811.994.544.78PGCN1.302.732.721.623.673.631.924.454.55AdpSTGCN1.292.712.691.603.603.591.854.324.48
传统统计模型(HA、ARIMA)与非图结构深度学习模型(FC-LSTM)预测性能有限。其原因在于仅捕捉时间相关性,忽视交通数据复杂空间关联性,而实际预测中空间特征至关重要。以DCRNN、STGCN为代表的时空图卷积模型,通过图卷积建模空间关系提升了预测精度。STGCN作为单步预测模型,递归多步时误差随步长累积,DCRNN采用Seq2Seq架构优化多步预测,但二者均依赖空间距离确定的固定邻接矩阵,难以准确刻画真实交通网络关联性。
Graph WaveNet结合图卷积与因果卷积实现多步预测,利用自适应参数生成图结构,但未引入节点属性且生成固定拉普拉斯矩阵,缺乏动态表征能力。GMAN通过多头注意力机制缓解多步误差累积,在60 min预测中接近AdpSTGCN,但其依赖全局注意力建模空间关系,未融合道路拓扑结构且计算复杂度高。DMSTGCN借助动态图生成算法捕获时空动态特性,中短期预测性能优于GMAN,但其依赖外部特征生成图结构,跨数据集稳定性不足。PGCN构建渐进图结合扩张卷积,在PEMS-Bay数据集15 min预测中MAE接近AdpSTGCN,但缺乏对全局稳定特征与局部动态波动的协同建模。相比之下,AdpSTGCN通过全局-局部双视角自适应推断动态图结构,兼顾时空相关性的稳定性与波动性建模,在多类模型对比中展现更强综合性能。
为了验证模型的鲁棒性,本文将METR-La数据集按月份分为4个子集,并与实验效果较好的Graph WaveNet模型进行比较,结果如表3所示。
表3 模型在不同时间段和不同子数据集上RMSE对比
Table 3 RMSEcomparison of the model on different time period and sub-datasets
模型时间段RMSEGraph WaveNetAdpSTGCN12012-03-01—2012-03-319.477.3422012-04-01—2012-04-307.536.5132012-05-01—2012-05-318.726.9242012-06-01—2012-06-306.325.34
通过实验数据发现,AdpSTGCN的表现优于Graph WaveNet,从而表明AdpSTGCN模型具有较高的鲁棒性。
为了验证AdpSTGCN不同子模块的有效性,本文在METR-La和PEMS-Bay数据集上进行了消融实验。AdpSTGCN的变体包括以下几个方面。
(1)w/o AL:去除自适应图结构学习组件,使用预定义的静态图来训练模型。探究自适应图学习组件对捕获动态交通模式的作用。
(2)w/o GDCRU:去除多步交通预测组件中的图扩散卷积循环单元模块,改用传统的GCN模块来训练模型,以分析GDCRU模块在捕获时空关系中的优势。
(3)w/o GTCN:去除多步交通预测组件中的GTCN模块,探讨该模块对建模全局时间相关性的影响。
表4展示了消融实验中各模型变体在15、30、60 min的对比预测结果,所有变体的具体设置除上述差异外均与AdpSTGCN设置保持一致。消融实验结果显示,AdpSTGCN的性能显著优于其他变体模型,充分验证了模型各组件的有效性。
表4 AdpSTGCN在不同数据集上消融实验结果
Table 4 Experimental results of AdpSTGCN ablation on different datasets
数据集模型15 min30 min60 minMAERMSEMAPE/%MAERMSEMAPE/%MAERMSEMAPE/%METR-Law/o AL2.795.317.303.256.438.723.727.4810.33w/o GDCRU2.685.086.823.056.128.273.507.209.87w/o GTCN2.705.106.863.086.158.303.527.189.84AdpSTGCN2.645.046.763.016.018.173.427.089.83PEMS-Bayw/o AL1.342.802.851.703.833.891.974.564.96w/o GDCRU1.302.722.711.623.653.621.884.344.49w/o GTCN1.312.742.731.633.663.681.904.384.48AdpSTGCN1.292.712.691.603.603.591.854.324.48
为了进一步验证自适应图结构组件及其他方法的优越性,本文在METR-La数据集上开展了一组消融实验。消融实验中,保持模型其他模块结构不变,将自适应图结构组件分别替换为预定义邻接矩阵及自适应图邻接矩阵[11]。结果如表5所示。
表5 不同图结构模块的性能比较
Table 5 Performance comparison of different graph structure modules
模块MAERMSEMAPE/%预定义邻接矩阵3.216.228.58自适应图邻接矩阵3.066.018.29自适应图结构2.965.898.05
由表5可知,使用预定义邻接矩阵和自适应图邻接矩阵的模型相较于自适应图结构的模型误差显著更高,这是因为前两者难以有效捕捉节点间的动态时空关联。
为了证明本文所设计的递进式训练方法的有效性,本文在METR-La数据集上将两种训练方法得到的结果进行了对比,其结果如表6所示。
表6 不同训练策略的性能比较
Table 6 Performance comparison of different training strategies
训练方法MAERMSEMAPE/%端到端训练3.156.048.42递进式训练2.965.898.05
由对比结果可以清晰看出,递进式训练方法在各项评估指标上均优于端到端训练。这是因为传统端到端训练方法在处理AdpSTGCN模型时,模型包含大量可学习参数且训练数据较为稀疏,难以对所有参数进行充分优化,容易陷入局部最优解,导致模型训练不充分,进而影响预测性能。而递进式训练方法采用分阶段训练策略,首先将全局层级图结构学习模块与交通状态预测组件相结合,对全局图结构进行预训练。这一过程为模型提供了良好的初始化条件,使得后续训练能够更高效地进行。在预训练阶段,模型学习到了交通网络中节点间的大致空间关系和长期趋势,为后续捕捉局部动态变化奠定了坚实基础。之后,将预训练的结果与局部图结构相结合,对整个模型进行微调。这种逐步优化的方式能够有效降低模型训练难度,使模型更好地收敛,充分学习到数据中的时空特征,从而在交通流量预测任务中表现更优。
本文针对交通流量预测中的关键挑战,提出了一种结合自适应图结构学习和时空卷积架构的自适应时空图卷积网络(AdpSTGCN)。通过设计基于节点属性的自适应图结构学习组件,从全局和局部两个视角动态建模复杂交通网络的空间依赖关系,同时构建了多层次的时空卷积网络架构,以更高效地捕捉交通流量中的时空相关性。此外,本文引入了递进式训练策略,有效缓解了模型参数过多和数据稀疏性带来的训练难度。实验结果表明,所提出的AdpSTGCN模型在METR-La和PEMS-Bay等公共交通数据集上,相较于当前主流模型,在短期和长期交通流量预测任务中均取得了显著的性能提升。通过自适应图结构学习组件,模型能够动态捕捉道路网络中的空间变化,而基于时空卷积的深度架构则有效挖掘了交通流量数据的时空相关性,从而提高了预测精度。
[1] Wang Jiahao, Li Wenbin, Guo Shiyao, et al. Urban traffic flow prediction based on global spatiotemporal graph convolutional neural network[J]. Computer Science, 2024, 51(S2): 534-542. [王佳昊, 黎文斌, 郭仕尧, 等. 基于全局时空图卷积神经网络的城市交通流量预测[J]. 计算机科学, 2024, 51(增刊2): 534-542.]
[2] Yang Gaofei, Xu Rui, Qin Ming, et al. Short-term traffic volume forecasting based on ARMA and Kalman filter[J]. Journal of Zhengzhou University (Engineering Science), 2017, 38(2): 36-40. [杨高飞, 徐睿, 秦鸣, 等. 基于ARMA和卡尔曼滤波的短时交通预测[J]. 郑州大学学报(工学版), 2017, 38(2): 36-40.]
[3] Yan He, Zhang Tianan, Qi Yong, et al. Short-term traffic flow prediction based on a hybrid optimization algorithm[J]. Applied Mathematical Modelling, 2022, 102: 385-404.
[4] Lin Guancen, Lin Aijing, Gu Danlei. Using support vector regression and K-nearest neighbors for short-term traffic flow prediction based on maximal information coefficient[J]. Information Sciences, 2022, 608: 517-531.
[5] Zhang Si, Tong Hanghang, Xu Jiejun, et al. Graph convolutional networks: a comprehensive review[J]. Computational Social Networks, 2019, 6: 11.
[6] Li Yaguang, Yu R, Shahabi C, et al. Diffusion convolutional recurrent neural network: data-driven traffic forecasting[PP/OL]. V1. arXiv,(2017-07-06)[2025-06-19].https:∥doi.org/10.48550/arXiv.1707.01926.
[7] Yu Bing, Yin Haoteng, Zhu Zhanxing. Spatio-temporal graph convolutional networks: a deep learning framework for traffic forecasting[PP/OL]. V4. arXiv (2018-07-12)[2026-01-19]. https:∥doi.org/10.48550/arXiv.1709.04875.
[8] Guo Shengnan, Lin Youfang, Feng Ning, et al. Attention based spatial-temporal graph convolutional networks for traffic flow forecasting[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2019, 33(1): 922-929.
[9] Zheng Chuanpan, Fan Xiaoliang, Wang Cheng, et al. GMAN: a graph multi-attention network for traffic prediction[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2020, 34(1): 1234-1241.
[10] Zhang Wei, Zhu Fenghua, Lv Yisheng, et al. AdapGL: an adaptive graph learning algorithm for traffic prediction based on spatiotemporal neural networks[J]. Transportation Research Part C: Emerging Technologies, 2022, 139: 103659.
[11] Wu Zonghan, Pan Shirui, Long Guodong, et al. Graph WaveNet for deep spatial-temporal graph modeling[PP/OL]. V1. arXiv (2019-05-31)[2026-01-19]. https:∥doi.org/10.48550/arXiv.1906.00121.
[12] Bai Lei, Bai Lei, Yao Lina, et al. Adaptive graph convolutional recurrent network for traffic forecasting[C]∥Proceedings of the 34th International Conference on Neural Information Processing Systems. New York: ACM, 2020: 17804-17815.
[13] Lin Junpeng, Li Ziyue, Li Zhishuai, et al. Dynamic causal graph convolutional network for traffic prediction[C]∥Proceedings of the 2023 IEEE 19th International Conference on Automation Science and Engineering (CASE). Piscataway: IEEE, 2023: 1-8.
[14] Diao Zulong, Wang Xin, Zhang Dafang, et al. Dynamic spatial-temporal graph convolutional neural networks for traffic forecasting[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2019, 33(1): 890-897.
[15] Lyu Mingqi, Hong Zhaoxiong, Chen Ling, et al. Temporal multi-graph convolutional network for traffic flow prediction[J]. IEEE Transactions on Intelligent Transportation Systems, 2021, 22(6): 3337-3348.
[16] Zhang Hong, Wang Hongyan, Chen Linlong, et al. Traffic flow forecasting based on transformer with diffusion graph attention network[J]. International Journal of Automotive Technology, 2024, 25(3): 455-468.
[17] Liu Haiyang, Zhu Chunjiang, Zhang Detian, et al. Attention-based spatial-temporal graph convolutional recurrent networks for traffic forecasting[C]∥Advanced data mining and applications. Cham: Springer Nature Switzerland, 2023: 630-645.
[18] Weng Wenchao, Fan Jin, Wu Huifeng, et al. A decomposition dynamic graph convolutional recurrent network for traffic forecasting[J]. Pattern Recognition, 2023, 142: 109670.
[19] Kong Xiangyuan, Xing Weiwei, Wei Xiang, et al. STGAT: spatial-temporal graph attention networks for traffic flow forecasting[J]. IEEE Access, 2020, 8: 134363-134372.
[20] Sha Ning, Wu Xiaochun, Wen Jinpeng, et al. Adaptive spatio-temporal graph convolutional network with attention mechanism for mobile edge network traffic prediction[J]. Cluster Computing, 2024, 27(9): 13257-13272.
[21] Li Yaguang, Shahabi C. A brief overview of machine learning methods for short-term traffic forecasting and future directions[J]. SIGSPATIAL Special, 2018, 10(1): 3-9.
[22] Pan Bei, Demiryurek U, Shahabi C. Utilizing real-world transportation data for accurate traffic prediction[C]∥Proceedings of the 2012 IEEE 12th International Conference on Data Mining. Piscataway: IEEE, 2012: 595-604.
[23] Sutskever I, Sutskever I, Vinyals O, et al. Sequence to sequence learning with neural networks[C]∥Proceedings of the 28th International Conference on Neural Information Processing Systems. New York: ACM, 2014: 3104-3112.
[24] Han Liangzhe, Du Bowen, Sun Leilei, et al. Dynamic and multi-faceted spatio-temporal deep learning for traffic speed forecasting[C]∥Proceedings of the 27th ACM SIGKDD Conference on Knowledge Discovery &Data Mining. New York: ACM, 2021: 547-555.
[25] Shin Y, Yoon Y. PGCN: progressive graph convolutional networks for spatial-temporal traffic forecasting[J]. IEEE Transactions on Intelligent Transportation Systems, 2024, 25(7): 7633-7644.