Py学习  »  机器学习算法

GIEHP研究进展 | 百度与谷歌街景能否协同描绘城市?深度学习揭示跨平台感知一致性

走天涯徐小洋地理数据科学 • 2 天前 • 29 次点击  
图片

近日,团队白婷婷和澳洲科廷大学宋泳泽教授合作完成的论文 “Deep learning reveals cross-platform consistency in street view imagery for urban perception mapping” 发表于国际城市研究期刊Computers, Environment and Urban Systems。研究以香港为案例,围绕百度街景影像(Baidu Street View,BSV)与谷歌街景影像(Google Street View,GSV)能否在城市环境感知研究中联合使用这一关键问题,构建了涵盖街景语义分割、城市情绪感知、集成学习空间制图、SHAP模型解释和多模型稳健性检验的完整技术框架。研究发现,BSV与GSV在植被、建筑和天空等主要街景结构要素上表现出较强一致性;在安全感、美感、活力感等模型感知维度上也保持中等至较高的一致性,但感知结果比客观街景结构更容易受到模型架构、拍摄时间和影像条件的影响。


论文信息

论文题目:Deep learning reveals cross-platform consistency in street view imagery for urban perception mapping
作者:Tingting Bai, Dong Xu, Feng Gao, Jiawei Liu, Yongze Song
期刊:Computers, Environment and Urban Systems
卷期:Volume 130, 2026
文章编号:102493
DOI:10.1016/j.compenvurbsys.2026.102493

一、研究背景

      随着城市研究逐渐从传统的“俯视城市”转向“以人为中心感知城市”,街景影像已成为刻画微观建成环境的重要数据来源。借助深度学习技术,研究者可以从街景影像中识别树木、建筑、天空、道路、人行道和车辆等环境要素,也可以进一步模拟人们对城市空间的安全、活力、美丽、富裕、无聊和压抑等主观感受。目前,谷歌街景在全球范围内覆盖广泛,而百度街景在中国及部分亚洲城市具有较高的数据覆盖率和更新频率。然而,两类街景影像在采集设备、拍摄时间、视角、光照、清晰度和色彩处理等方面存在差异。这些差异是否会影响街景要素提取和城市感知评价,成为多源街景数据联合应用必须解决的问题。现有研究大多依赖单一街景平台,且主要关注绿视率、建筑密度等客观街景结构。对于不同平台能否产生相近的城市情绪感知结果,尤其是在统一模型和统一分类体系下是否具有可比性,仍缺乏系统检验。


二、研究问题

围绕多源街景影像的可比性和可迁移性,研究重点回答以下三个问题。

  • 第一,在相同空间位置和统一语义分割模型下,BSV与GSV提取的植被、建筑和天空等主要街景要素是否一致?

  • 第二,基于统一城市感知模型,两类街景影像产生的安全感、美感、富裕感、活力感、无聊感和压抑感是否具有跨平台一致性?

  • 第三,当离散街景采样点被扩展为连续空间感知地图后,两类平台在像元尺度上的空间格局是否仍然一致?街景要素与城市情绪之间的关联路径能否在不同平台间保持稳定?

三、研究结果

      研究首先从采样点尺度检验了百度街景影像与谷歌街景影像在主要街景语义要素识别方面的一致性。结果显示,两类街景平台提取的建筑、植被和天空比例均呈显著正相关,其中建筑要素的相关系数为0.756,植被要素的相关系数为0.753,天空要素的相关系数为0.720。总体来看,两个平台在识别街景中占比较大、空间结构相对稳定的核心视觉要素时具有较高的一致性。进一步采用SegFormer、DeepLabv3+等不同语义分割模型,并分别结合ADE20K和Cityscapes标签体系开展稳健性检验后,植被、建筑和天空的跨平台相关关系仍然保持稳定,说明研究结论并不依赖单一的模型架构或语义标签体系。局部差异主要可能来源于影像拍摄角度、遮挡状况、光照条件、清晰度及平台影像处理方式的不同。

       在城市情绪感知方面,百度街景与谷歌街景在安全感、美感、富裕感、活力感、无聊感和压抑感六个维度上均表现出正向一致性,但相关程度总体低于客观街景结构要素。基于VGG-16模型得到的跨平台Pearson相关系数介于0.591至0.672之间,其中压抑感的一致性相对较低,安全感的一致性相对较高。从空间分布看,香港中环、金钟和铜锣湾等核心城区在两个平台上均呈现较高的富裕感、活力感和美感,而新界北部及元朗等城市边缘区域则表现出相对较高的无聊感和压抑感。采用ResNet50和CLIP图像编码器进行敏感性检验后,六类情绪指标仍保持正向的跨平台相关关系,但不同模型得到的相关强度存在差异,表明城市情绪感知结果具有一定的跨平台稳定性,同时也比语义结构指标更容易受到模型主干网络、色彩表达、拍摄时段和场景差异的影响。

      在连续空间制图方面,研究利用七种基础机器学习模型和二层Stacking集成学习模型,分别生成了基于百度街景和谷歌街景的连续植被空间分布图。结果表明,各单一模型能够较好识别香港山地、城市公园和滨水林带等高绿量区域,但在城市边缘和复杂地表过渡区仍可能出现空间破碎、边界突变或局部过拟合现象。相比之下,二层Stacking模型综合了不同基础模型的预测优势,在空间连续性、边界过渡和高值区域识别方面表现更为稳定。对于植被制图,百度街景和谷歌街景驱动的二层Stacking模型均达到0.985的决定系数和0.992的相关系数,均方根误差分别下降至0.022和0.014。其中,谷歌街景模型的表现略优,可能与其影像清晰度和场景完整性相对较高有关。

      对于城市美感的连续空间模拟,七种基础模型在主要道路、开放绿地、滨水空间和低密度居住区普遍预测出较高的美感水平,但在高密度建成区、城市边缘和山地交错区域,不同模型的预测结果存在较明显差异。部分模型容易低估高密度街景中的视觉复杂性,另一些模型则可能将建筑排列的规则性误判为较高美感。二层Stacking模型通过整合多个模型的预测结果,明显改善了美感地图的空间连续性和感知边界识别能力。基于百度街景和谷歌街景的美感模型决定系数均超过0.980,相关系数均超过0.990,均方根误差均降至0.032,系统偏差接近于零。与植被制图不同,百度街景驱动的美感模型表现略优于谷歌街景,这表明不同街景平台在客观环境结构模拟和主观感知模拟中的相对优势并不完全一致。

      像元尺度的移动窗口分析进一步揭示了两类平台在连续空间格局上的一致性差异。百度街景和谷歌街景模拟的植被分布具有较强的空间一致性,平均相关系数达到0.84,超过98%的研究区域在p<0.001水平上显著。这说明植被作为能够从影像像元中直接识别的客观视觉要素,具有较强的跨平台稳健性。相比之下,美感空间分布虽然总体保持正相关,整体相关系数约为0.645,但局部地区的相关程度波动较大,部分区域甚至出现较低或轻微负相关。其原因在于美感不仅受到植被数量影响,还同时受到建筑形态、道路结构、空间开敞度、色彩对比、遮挡、光照和拍摄角度等多重因素的共同作用,因此其跨平台一致性相对弱于植被等客观结构指标。

     SHAP解释结果显示,百度街景和谷歌街景所揭示的“街景结构—城市美感”关联路径总体相似。树木在两个平台中均是提升美感最重要和最稳定的街景要素。随着树木或林冠比例增加,其对美感的正向贡献逐渐增强,但在达到一定水平后边际效应趋于平缓,说明增加城市绿化通常有助于改善视觉感受,但单纯提高绿量并不会无限提升美感。车辆、卡车、围墙、围栏和部分硬质人工设施则通常对美感产生负向影响,可能反映了交通压力、噪声、污染、视觉拥挤和空间封闭感。尽管天空、人行道等个别要素在两个平台中的作用方向或贡献强度存在一定差异,但树木的正向作用以及机动车辆和硬质围挡的负向作用表现出较稳定的跨平台特征。

      Mantel检验进一步表明,街景语义结构与城市情绪感知之间存在显著的整体对应关系。美感与树木呈正相关,而与道路和天空呈负相关;压抑感与道路呈正相关,而与树木呈负相关;活力感和富裕感与建筑要素呈现较明显的正向联系。不同道路类型也表现出差异化的情绪特征,步行街、自行车道和路径等以慢行活动为主的道路具有较高的美感,快速路则表现出较高的压抑感,城市主干道的安全感和富裕感相对较高。上述结果说明,城市视觉体验和情绪感知并非由单一环境要素决定,而是自然景观、建筑空间、道路交通和人类活动共同作用的结果。总体而言,百度街景与谷歌街景不仅在主要街景结构和空间分布上具有较强一致性,在街景要素影响城市情绪的解释路径上也表现出较高程度的可迁移性。

全球智能生态地平线计划(GIEHP)是一项面向全球的开放科学倡议,致力于通过遥感观测、人工智能和云计算的深度融合,构建高分辨率、近实时的全球生态环境监测与智能分析平台。当前,GIEHP实现了对水、陆、大气、城市四大生态系统超过300个关键指标的近实时计算与数据发布。数据已开放共享于GIEHP门户网站与GIEHP国际站点,为气候变化研究、政策评估与可持续发展目标(SDGs)的实现提供科学支撑。我们诚挚邀请来自地理学、生态学、气候科学及相关领域的研究人员和机构开展深入合作,共同推动全球生态环境数据的创新应用与学术前沿探索。高维数据申请与合作请联系:data@giehp.com

图片


Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/199246