3.2 数据来源与数据融合
研究使用2023年的三类数据:Caltrans AADT交通计数数据、SWITRS交通事故记录以及CTP基础设施元数据。研究利用经纬度进行最近邻匹配,其中CTP项目采用KD-tree进行匹配,交通事故采用BallTree进行匹配,并设置约1公里的最大匹配距离。
模型目标变量AVG_AADT由道路两个方向的AHEAD_AADT和BACK_AADT取算术平均得到,而这两个方向的交通计数并未作为预测变量输入模型,以避免数据泄漏。
3.3 特征与预处理
模型特征包括经纬度、项目资金、CES评分、道路路线和区域信息,以及交通事故中的死亡人数和受伤人数等指标,同时包含燃料类型、道路类型、城市、县、天气和路况等类别变量。
预处理包括删除缺失空间坐标的数据、进行空间匹配、构建AADT目标变量、聚合交通事故特征以及类别变量编码。
3.4 模型及训练方法
研究比较了树集成模型、线性及正则化回归、K近邻和浅层神经网络等模型,并使用AutoML完成预处理、超参数搜索、Bagging、K折交叉验证和最终堆叠集成。
3.5 超参数优化
AutoML根据交叉验证结果自动搜索不同模型的超参数,以降低预测误差,并进一步组合不同基础模型的预测结果形成堆叠集成模型。
3.6 计算环境
研究使用Python完成数据处理、机器学习建模、AutoML训练、空间数据匹配和SHAP模型解释。
3.7 对比方案、误差分析与统计检验
研究分别比较交通数据、能源数据和融合数据三种特征配置,并采用MAE、RMSE、R²和MAPE评价模型性能。同时按照低、中、高三个AADT区间进行误差分析,并通过Wilcoxon符号秩检验比较堆叠集成和随机森林的预测差异。