社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  机器学习算法

数字工程 | 融合多源数据与机器学习的交通量估算

数字孪生DigitalTwin • 1 周前 • 62 次点击  

点击蓝字 关注我们↑↑↑

DIGITAL TWIN

如果您不希望错过文章,就加个星标吧!



期刊介绍

Introduction


《Digital Engineering》英文国际期刊(ISSN:2950-550X)是全球首个专注于数字工程的跨学科领域学术期刊,由国际著名学术期刊出版商爱思唯尔Elsevier 出版,主要发表高质量的原创研究论文、综述、简报和评论,旨在分享各领域关于数字化研究和应用的最新成果。期刊目前已被EI及Scopus收录。


本期阅读

 文章信息 

论文“Improved non-coverage annual average daily traffic estimation using openly available infrastructure data”于2026年7月发表于Digital Engineering期刊。本文由美国北卡罗来纳农工州立大学的A. A. Taiwo、B. Shuaib、G. Comert等人完成,本文提出了一种基于多源数据融合和自动化机器学习(AutoML)的框架,用于在缺乏直接传感器数据的路段准确估算年均日交通量(AADT)。

DOI:https://doi.org/10.1016/j.dte.2026.100133


 文章阅读   


Improved non-coverage annual average daily traffic estimation using openly available infrastructure data

A. A. Taiwo、B. Shuaib、G. Comert、N. Begashaw、J. A. Owusu

作者单位

a Department of Computational Data Science and Engineering, North Carolina Agricultural and Technical State University, 1601 E Market St, Greensboro, NC, 27411, USA

b Department of Computer Science, Physics and Engineering, Benedict College, 1600 Harden Street, Columbia, SC, 29204, USA



摘要:

准确的年平均日交通量(Annual Average Daily Traffic,AADT)对于基础设施规划、环境评估和道路安全分析具有重要意义。然而,由于连续交通计数设备建设和维护成本较高,许多道路路段,尤其是农村和地方道路,缺乏直接的交通观测数据。


本文提出一种数据融合框架,通过整合交通事故记录、清洁能源基础设施元数据和道路特征,对缺乏监测覆盖的道路路段进行AADT估算。研究比较了随机森林、梯度提升、线性及正则化回归、K近邻和浅层神经网络等多种机器学习模型,并利用自动机器学习完成数据预处理、模型训练、验证和集成。


结果表明,在交通数据、能源数据以及多源融合数据三种特征配置下,堆叠集成模型均取得了较好的预测性能。研究表明,多源数据融合与集成学习能够有效提升数据稀疏道路环境下的交通量估算能力。


1. 引言

年平均日交通量(AADT)是交通基础设施规划、道路安全评价、环境影响评估和投资决策中的重要指标。准确的交通量估计还能够支持路面维护、拥堵缓解和排放分析。


然而,永久性交通计数站的建设和维护成本较高,难以覆盖整个道路网络,因此大量农村和地方道路缺乏直接交通观测。已有研究主要采用短期交通计数外推、回归模型和机器学习等方法进行AADT估算,但现有方法往往依赖单一类型的数据,对道路、事故和基础设施等异构数据的联合利用仍较有限。


针对这一问题,本文提出融合道路属性、交通事故记录和清洁能源基础设施元数据的数据融合机器学习框架,并通过堆叠集成提高预测性能,同时利用SHAP分析解释影响AADT预测的主要因素。


2. 文献综述

年平均日交通量(Annual Average Daily Traffic,AADT)是基础设施规划、道路安全评价、环境评估和交通规划中的重要指标。由于永久性交通计数站建设和维护成本较高,许多道路,尤其是农村和地方道路,缺乏连续的交通观测数据。因此,已有研究主要通过短期交通计数、季节和日变化因子以及统计回归等方法估算AADT,并逐步引入人口密度、道路类型、车道数量和道路可达性等特征。


近年来,机器学习方法被应用于交通流量估算和缺失数据重构,其能够处理复杂的非线性关系,并结合多种道路及环境信息;集成学习则通过组合不同模型进一步提高预测稳定性。尽管如此,现有研究对多源异构基础设施数据的联合利用仍然有限,清洁交通项目及相关环境指标在AADT估算中的作用也缺乏充分研究。同时,如何利用自动机器学习和集成方法提高预测性能,并通过可解释方法揭示不同数据特征对AADT预测的影响,仍有进一步研究的空间。


3. 方法

3.1 研究框架

研究主要包括数据获取、空间数据融合、特征工程与预处理、模型训练以及集成与解释五个阶段。研究使用Caltrans AADT交通数据、SWITRS交通事故数据和清洁交通项目(CTP)基础设施数据,并通过空间匹配将不同来源的数据关联到道路路段。

图1.工作流程


3.2 数据来源与数据融合

研究使用2023年的三类数据:Caltrans AADT交通计数数据、SWITRS交通事故记录以及CTP基础设施元数据。研究利用经纬度进行最近邻匹配,其中CTP项目采用KD-tree进行匹配,交通事故采用BallTree进行匹配,并设置约1公里的最大匹配距离。


模型目标变量AVG_AADT由道路两个方向的AHEAD_AADT和BACK_AADT取算术平均得到,而这两个方向的交通计数并未作为预测变量输入模型,以避免数据泄漏。


3.3 特征与预处理

模型特征包括经纬度、项目资金、CES评分、道路路线和区域信息,以及交通事故中的死亡人数和受伤人数等指标,同时包含燃料类型、道路类型、城市、县、天气和路况等类别变量。


预处理包括删除缺失空间坐标的数据、进行空间匹配、构建AADT目标变量、聚合交通事故特征以及类别变量编码。


3.4 模型及训练方法

研究比较了树集成模型、线性及正则化回归、K近邻和浅层神经网络等模型,并使用AutoML完成预处理、超参数搜索、Bagging、K折交叉验证和最终堆叠集成。


3.5 超参数优化

AutoML根据交叉验证结果自动搜索不同模型的超参数,以降低预测误差,并进一步组合不同基础模型的预测结果形成堆叠集成模型。


3.6 计算环境

研究使用Python完成数据处理、机器学习建模、AutoML训练、空间数据匹配和SHAP模型解释。


3.7 对比方案、误差分析与统计检验

研究分别比较交通数据、能源数据和融合数据三种特征配置,并采用MAE、RMSE、R²和MAPE评价模型性能。同时按照低、中、高三个AADT区间进行误差分析,并通过Wilcoxon符号秩检验比较堆叠集成和随机森林的预测差异。


4. 结果:不同特征数据的建模与评价

总体结果显示,在三种特征配置下,堆叠集成模型均比随机森林具有更低的预测误差。其中,仅使用交通数据和能源数据时,MAPE均较高;融合多源数据后,预测误差明显降低。


4.1 仅使用交通数据的建模

交通数据模型能够捕捉整体交通量变化趋势。随机森林的MAE为25,027辆/天,R²为0.75;堆叠集成将MAE降低至18,130辆/天,R²提高至0.84。但对于非常高的交通量路段,模型仍存在低估现象。


4.2 仅使用能源数据的建模

能源数据能够提供一定的交通量预测信息,但单独使用时预测能力有限。随机森林MAE为43,439辆/天,R²为0.38;堆叠集成将MAE降低至33,559辆/天,R²提高至0.52。


4.3 混合数据集建模:综合预测分析

融合交通、事故和能源基础设施数据后,模型性能显著提高。随机森林的MAE为985辆/天,RMSE为5169辆/天,R²为0.99,MAPE为5.15%;堆叠集成进一步将MAE降低至570辆/天,RMSE降低至1415辆/天,MAPE降至3.73%,R²保持在0.99。


SHAP分析显示,经纬度、CES评分、项目资金、燃料类型以及事故死亡和受伤人数等变量对预测结果具有较大影响。空间误差分析表明,洛杉矶、旧金山湾区和萨克拉门托等城市区域的预测误差较低,而农村和欠发达道路的误差相对较高。


5. 结论

本文提出了一种融合交通属性、交通事故记录和清洁能源基础设施元数据的数据融合机器学习框架,用于估算缺乏直接交通监测的道路路段交通量。


研究结果表明,随着互补数据源的加入,模型的预测精度和稳定性得到明显提升。堆叠集成在不同特征配置下均优于随机森林,融合数据配置取得最佳结果,R²约为0.99,MAE约为570辆/天,MAPE低于4%。SHAP分析进一步表明,空间位置、环境负荷、基础设施投资以及聚合后的交通事故指标是重要影响因素。



关注公众号,后台回复“DE”即可下载原文

更多数字工程相关内容

请点击下方卡片浏览DE期刊目录


Vol. 1

Vol. 2

Vol. 3


Vol. 4

Vol. 5

Vol. 6


Vol. 7

Vol. 8

Vol. 9



《Digital Engineering》期刊采取“开放获取”(Open Access)出版模式,所有的文章免费访问。在2024年和2025年免除作者文章出版费用(Article Publishing Charge)。


《Digital Engineering》诚邀您的投稿!


对本刊感兴趣的老师,欢迎扫码添加好友,获取更多动态信息。↓↓↓


DIGITAL ENGINEERING



Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/201385