统一知识库检索

全局检索与知识浏览

跨论文、博客、数据集线索、项目和工具统一检索。检索结果可以继续跳转到独立问答页,做语义追问和来源核验。

检索条件
用当前检索词继续问答
当前展示 24 条,共 694
筛选后的知识库结果
首页/全局检索
论文
Cities
PublisherJournal
UrbanComputing
弥合数字鸿沟:用户生成数据与志愿型城市感知在包容性智慧城市治理中的应用
Bridging digital divides: User-generated data and volunteered urban sensing for inclusive smart city governance

出版日期:2026年12月;来源:《Cities》,第179卷;作者:Dulce María Villegas Núñez、Björn Niehaves

论文
Computers, Environment and Urban Systems
PublisherJournal
天气有影响吗?基于街景图像的城市感知评估中的测量偏差探究
Does weather matter? Examining measurement bias in street view image-based urban perception assessments

发表日期:2026年7月 来源:《计算机、环境与城市系统》,第127卷 作者:金东焕,李承敏,韩彩妍,金友贞,高奉宇,黄义正

Computers, Environment and Urban Systems
论文
Transactions in GIS
PublisherJournal
GeoAI
利用街景图像估计客观城市感知:以生理唤醒为例
Estimating Objective Urban Perception by Using Street View Images: An Application to Physiological Arousal

《国际地理信息系统汇刊》(Transactions in GIS),第30卷,第5期,2026年8月。

Wei Jiang, Jing Mao, Shuo Gong, Xinyue Zheng, Jingjing Zhao, Yi Long
2026/08/03
论文
Computers, Environment and Urban Systems
PublisherJournal
UrbanComputing
从地震信号到城市感知:利用环境地震噪声监测极端天气事件中人类活动的扰动
From seismic signals to urban sensing: Leveraging ambient seismic noise to sense human activity disruptions in extreme weather events

出版日期:2026年7月;来源:《计算机、环境与城市系统》(Computers, Environment and Urban Systems),第127卷;作者:郝天、蔡恒、陈晓伟、Ahmad Mohammadi Ghanatghestani、Lawrence Arthur

Computers, Environment and Urban Systems
论文
Computers, Environment and Urban Systems
PublisherJournal
Platform
深度学习揭示街景影像在城市感知制图中的跨平台一致性
Deep learning reveals cross-platform consistency in street view imagery for urban perception mapping

出版日期:2026年12月;来源:《Computers, Environment and Urban Systems》,第130卷;作者:白婷婷、徐东、高锋、刘佳伟、宋永泽

Computers, Environment and Urban Systems
论文
arXiv
Multimodal
利用人类注视建模主观城市感知
Modeling Subjective Urban Perception with Human Gaze

城市感知描述了人们如何主观评估城市环境,从而塑造城市被体验与理解的方式。现有计算方法主要直接从街景图像建模城市感知,却在很大程度上忽略了形成此类判断所依赖的人类感知过程。本文提出 Place Pulse-Gaze 数据集,该数据集在街景图像基础上同步增加了眼动追踪记录及个体感知标签。基于该数据集,我们构建了注视引导的城市感知框架(Gaze-Guided Urban Perception Framework),以研究注视行为如何助力主观城市感知的建模。该框架系统性地考察了三种互补设定:仅使用注视信息建模、将注视信息与显式语义场景表征相融合、以及将注视信息与隐式更丰富的视觉表征相融合。实验表明,仅注视信息本身已包含对主观城市感知具有预测价值的信号;而将注视信息与场景表征相结合,可在语义表征与更丰富视觉表征两种设定下进一步提升预测性能。总体而言,我们的发现强调了在城市场景理解中纳入人类感知过程的重要性,并为注视引导的多模态城市计算开辟了新方向。

Lin Che, Xi Wang, Marc Pollefeys
2026/05/02
论文
arXiv
Trajectory
Mobility
驱动城市感知的视觉杠杆有多少?基于多重局部化编辑的干预性反事实分析
How Many Visual Levers Drive Urban Perception? Interventional Counterfactuals via Multiple Localised Edits

街景感知模型可大规模预测安全等主观属性,但其本质仍为相关性建模:无法识别针对特定场景、可能改变人类判断的局部视觉变化。我们提出一种基于杠杆的干预性反事实框架,将场景级可解释性重构为在结构化反事实编辑空间内的有界搜索。每个杠杆定义一个语义概念、空间支持范围、干预方向及受约束的编辑模板。候选编辑通过提示词引导的图像编辑生成,并仅在满足同地点保持性、局部性、真实性和合理性等有效性检验时予以保留。在来自五座城市的50个场景的初步实验中,该框架揭示了基于代理的方向性模式初探结果,以及纯提示编辑下的实用失效分类体系;其中,交通基础设施(Mobility Infrastructure)与物理维护(Physical Maintenance)两类杠杆引发的安全性辅助变化最为显著。人类成对判断仍为未来验证的基准真值终点。

Jason Tang, Stephen Law
2026/04/24
论文
arXiv
Trajectory
Mobility
语言驱动的多智能体规划:面向个性化与公平性的参与式城市感知
Language-Grounded Multi-Agent Planning for Personalized and Fair Participatory Urban Sensing

参与式城市感知利用人类移动性实现大规模城市数据采集,但现有方法通常依赖中心化优化,并假设参与者同质化,导致任务分配僵化,忽视个人偏好及城市环境的异质性。我们提出 MAPUS——一种基于大语言模型(LLM)的多智能体框架,用于支持个性化与公平性的参与式城市感知。在该框架中,参与者被建模为具备个体档案与日程安排的自主智能体,而协调智能体则执行兼顾公平性的选择,并通过基于自然语言的协商机制优化感知路径。在真实世界数据集上的实验表明,MAPUS 在保持具有竞争力的感知覆盖率的同时,显著提升了参与者满意度与公平性,从而推动构建更以人为中心、更具可持续性的城市感知系统。

Xusen Guo, Mingxing Peng, Hongliang Lu
2026/03/25
论文
arXiv
LLM
Multimodal
视觉-语言模型如何看待城市场景?一个城市感知基准
Do Vision-Language Models See Urban Scenes as People Do? An Urban Perception Benchmark

理解人类如何解读城市场景可为设计与规划提供依据。我们引入了一个小型基准,用于测试视觉-语言模型(VLMs)在城市感知方面的表现,采用100张蒙特利尔街景图像,照片与逼真合成场景各占一半。来自七个社区团体的12名参与者提供了涵盖30个维度的230份标注表单,包含物理属性与主观印象。法语回答经标准化处理为英文。我们在零样本设置下,使用结构化提示和确定性解析器评估了七种VLMs。对于单选题采用准确率,多标签题采用Jaccard重叠度;人类标注一致性使用Krippendorff's alpha和成对Jaccard计算。结果表明,模型在可见的客观属性上表现出更强的对齐性,而在主观评价方面则较弱。表现最佳的系统(claude-sonnet)在多标签任务上的宏平均准确率为0.31,平均Jaccard值为0.48。人类标注一致性较高时,模型得分也相应更高。合成图像略微降低模型表现。我们公开发布该基准、提示模板及评估工具包,以支持参与式城市分析中的可复现且具备不确定性意识的评估。

Rashid Mushkani
2025/09/18
论文
Transportation Research Part C
PublisherJournal
UrbanComputing
面向机会式城市感知的车辆车队优化:一种上下文感知的基于熵的方法
Vehicle fleet optimization for opportunistic urban sensing: A context-aware entropy-based approach

出版日期:2026年5月;来源:《交通研究C辑:新兴技术》,第186卷;作者:钟辉、卢庆龙、龙志旭、刘永红、郑欣湖

Transportation Research Part C
论文
arXiv
LLM
Multimodal
大语言模型中城市感知的文化非均衡性
Culturally uneven urban perception in large language models

大型语言模型(LLMs)正日益被用于描述与评估城市,但其城市判断背后的文化结构仍缺乏深入研究。本文提出一种测量框架,用以检验基于LLM的城市感知是否具有文化中立性,该框架依托一个全球分层的街景图像数据集。三个前沿多模态模型生成的开放式描述与结构化评分均表明,所谓中立基线更接近于欧洲与北美地区相关的地方性认知框架,而非其他文化框架。AI与人类城市感知的对比进一步显示,提示工程(prompting)虽可使AI响应趋近特定区域的人类描述,却无法复现人类响应的丰富性与多样性,反而会弱化可观测的人口统计学模式,并引入基于情感的自我偏好偏差。这些结果表明,在将AI视为城市任务中的中立工具时存在系统性风险,尤其当模型输出被用于跨文化语境下的城市比较、评估或表征时。

Rong Zhao, Wanqi Liu, Zhizhou Sha
2026/04/22
论文
Transactions in GIS
PublisherJournal
GeoAI
跨模态城市感知:评估街景影像与航拍影像中的声-视对齐
Cross‐Modal Urban Sensing: Evaluating Sound–Vision Alignment Across Street‐Level and Aerial Imagery

《国际地理信息系统汇刊》(Transactions in GIS),2026年4月,第30卷,第2期。

Pengyu Chen, Xiao Huang, Teng Fei, Sicheng Wang
2026/03/27
论文
arXiv
SpatialIntelligence
Trajectory
CityOS:面向城市感知的隐私架构
CityOS: Privacy Architecture for Urban Sensing

城市正快速部署各类感知基础设施——包括摄像头、环境传感器和联网信息亭——持续监测公共空间,但尚缺乏一套系统架构来规范应用程序对这些数据的访问、聚合与存储,由此引发隐私风险,并阻碍隐私政策的一致执行。本文提出 CityOS,一种面向城市感知的操作系统,其通过受结构化、隐私优先的 Web 接口启发的三层 API,中介应用程序对传感器数据的访问。各层在扩大数据空间覆盖范围的同时,施加逐级增强的隐私约束:现场层(On-Scene)支持实时感知,原始数据严格限定于本地上下文;单地点聚合层(Single-Locality Aggregation)在固定位置生成满足差分隐私要求的纵向统计结果;跨地点聚合层(Cross-Locality Aggregation)支持跨区域的城市级分析,由用户设备强制执行按用户的隐私预算。CityOS 作为边缘运行时环境,以临时容器方式执行不可信应用程序,强制实施上述策略,并通过广播差分隐私损失实现透明性。我们实现了 CityOS 及覆盖全部三层的应用程序,包括行人安全预警、实时与预测停车位可用性、交通态势仪表盘以及地铁轨迹测量等,并验证其可在保障强隐私的前提下支撑实际街道场景应用。

Giorgio Cavicchioli, Mark Chen, Navid Salami Pargoo
2026/05/05
论文
arXiv
LLM
Multimodal
多模态城市感知中的角色提示:描述性收敛与解释性变异
Persona Prompting in Multimodal Urban Perception: Descriptive Convergence and Interpretive Variation

本研究考察角色提示(persona prompting)如何影响两个多模态大语言模型(Qwen3-VL-8B 和 Gemma-4-E4B-it)在城市感知任务中生成的语言,该任务为探究共享视觉证据下主观解释的差异提供了典型场景。我们将模型输出划分为三个功能层级:描述性基础层(图像描述)、中间语义层(感知标签)和解释性框架层(理由陈述)。基于每模型约 60,000 条经角色条件化标注的数据,我们发现图像描述在不同角色档案间高度收敛,仅在属性关联维度上呈现微小差异;而理由陈述的变异程度显著更高:经济地位在两个模型中均引发最大差异,政治取向与人格特质亦具显著影响。配对图像级比较进一步证实,上述三类属性所导致的理由陈述差异均大于其图像描述差异。对于感知标签,具有相同属性水平的角色生成的标签集合相似度高于属性水平不同的角色,其中经济地位所导致的分离度最大。探索性主题分析还揭示了角色特异性的评价侧重。跨模型分析显示,所有三类输出中角色档案对之间的相似性模式均呈强相关性,但理由陈述的一致性最低。总体而言,角色提示对解释性框架的影响强于对描述性基础的影响。

Neemias da Silva, Matt Ratto, Myriam Delgado
2026/05/28
论文
International Journal of Geographical Information Science
UrbanCompLab
GeoAI
基于街景图像的人机对抗评分框架用于城市感知评估
A human-machine adversarial scoring framework for urban perception assessment using street-view images

尽管近年来已利用机器学习构建了全球覆盖的城市感知数据集,但其在准确评估其他国家和地区局部城市感知方面的有效性仍存在问题。本文描述了一种基于深度学习与迭代反馈及推荐评分相结合的方法,提出了一种人机对抗评分框架,可实现对中国城市局部城市感知的快速、低成本评估。采用先进的全卷积网络(FCN)和随机森林(RF)算法,该方法的感知估计误差低于10%。从视觉特征和城市功能两个方面进行驱动因素分析,验证了其在推导局部城市感知方面的可行性。该人机对抗框架具备高通量与高精度评分能力,为城市规划者和研究人员提供了一种经济、快速的局部城市感知评估解决方案。

Yao, Yao, Liang, Zhaotang, Yuan, Zehao
2019/01/01
论文
arXiv
AI
PairWise Image Finder:一种面向城市感知研究的开源街景图像对视觉对齐查找工具
PairWise Image Finder: An Open-source Tool for Finding Visually Aligned Street-Level Image Pairs for Urban Perception Studies

变化检测与场景识别技术已被广泛应用于街景影像(SVI),以理解跨年度场景的变化。然而,仅依赖元数据往往不足以可靠地找到视觉上对齐的图像对。本研究提出 PairWise Image Finder 工具,该工具融合特征检测与匹配,并借助语义分割掩膜来量化不同时期两幅图像之间的视觉对齐程度。该工具输出匹配关键特征的比例、匹配特征的距离与覆盖范围,以及语义掩膜的对齐度,使用户可根据对齐质量与具体应用场景筛选图像对。由此获得的视觉对齐图像对可用于精确开展显式纵向变化分析,并有助于降低城市感知研究中的人工工作量。本研究通过纵向变化对比分析验证了该工具的可用性,并强调了在量化变化时视角的重要性。所提出的方案为研究人员与相关利益方提供了一种可扩展、开源的工具,用于城市分析、感知及相关应用中高质量图像对的查找。

Jussi Torkko
2026/06/08
论文
arXiv
LLM
Multimodal
面向城市感知的视觉-语言模型基准测试应具备可靠性意识并经协商确立
Benchmarks for Vision-Language Models in Urban Perception Should Be Reliability-Aware and Negotiated

视觉-语言模型(VLMs)正日益被用于生成街景图像的结构化描述,以支持街道环境评估、制图及公众咨询等任务。此类应用将可观测属性与评价性类别相结合,其目标人群常表现为存在分歧与明确拒答的判断分布。本文主张:针对城市感知任务的VLM基准测试,应将人类判断间的分歧与主动弃答视为测量结果本身;在报告模型与人类标注一致性的同时,须一并报告标注者间信度(inter-annotator reliability);且当模型输出旨在为城市治理提供依据时,标签空间与评分策略应被视为可协商的技术产物。本论点基于一项实证基准研究:对蒙特利尔100个街景样本,由来自7个社区组织的12名参与者在30个维度上进行标注,并对7种VLM开展确定性零样本评估。结果显示,各维度上模型与人类共识的一致性与其对应维度的人类标注信度呈共变关系;而在评价性维度“总体印象”(Overall Impression)上,模型与人类标注者之间存在分布错配,包括“不适用”(Not applicable)选项使用率的差异。最后,本文提出若干行动建议,供基准构建者、模型开发者及相关机构采纳,以在评估报告中显式呈现不确定性及基准假设。

Rashid Mushkani
2026/05/31
论文
arXiv
LLM
Multimodal
分析多模态大语言模型代理在城市感知任务中生成解释时的虚拟角色效应
Analyzing Persona Effects in Generated Explanations from Multimodal LLM Agents in Urban Perception

本研究探讨虚拟角色提示(persona prompting)如何影响多模态大语言模型(multimodal LLM)在城市感知场景下所生成的语言。我们基于1,200个带虚拟角色条件的代理与两个无虚拟角色对照组所产生的59,808条标注,分析了不同虚拟角色下的图像描述(captions)、合理性说明(justifications)及感知标签(perception tags)。结果表明:不同虚拟角色在图像描述上呈现高度一致性;合理性说明则随社会经济属性与政治属性呈现系统性差异;感知标签未显示出统计显著的虚拟角色相关差异,但可观察到微弱的效应趋势。主题分析进一步揭示,不同虚拟角色在解释相同场景时侧重不同的评价性主题。

Neemias da Silva, Myriam Delgado, Rodrigo Minetto
2026/05/28
论文
International Journal of Digital Earth
PublisherJournal
UrbanComputing
从像素到感知:面向语义城市感知的视觉-语言模型微调
From pixels to perception: fine-tuning vision-language models for semantic urban perception
Guanjie Huang Xifa Song Hongzan Jiao a Department of Urban Planning, School of Urban Design, Wuhan University, Wuhan, People's Republic of China b Aerospace Information Research Institute, Henan Academy of Sciencess, Henan, People's Republic of China
2026/05/25
项目
GitHub Repositories
street-view
urban-perception
yanyuelin721/rubric-to-map:面向视觉语言模型(VLM)审计、语义校准及街景影像点级城市感知制图的Rubric-to-Map框架(武汉天地案例研究)
yanyuelin721/rubric-to-map: Rubric-to-Map Framework for VLM Auditing, Semantic Calibration, and Point-Level Urban Perception Mapping from Street-View Imagery (Wuhan Tiandi case study).

面向视觉语言模型(VLM)审计、语义校准及街景影像点级城市感知制图的Rubric-to-Map框架(武汉天地案例研究)。主题包括校准、地理信息系统(GIS)、大语言模型(LLM)、可重复性、街景影像、城市分析。本GitHub仓库由yanyuelin721(开发者)维护。主要编程语言:Python。最后更新时间:2026-03-29。# Rubric-to-Map 可重复性软件包 [![DOI](https://zenodo.org/badge/DOI/10.5281/zenodo.18897096.svg)](https://doi.org/10.5281/zenodo.18897096) 该公开可重复性软件包支持Rubric-to-Map框架在VLM审计、语义校准及点级城市感知制图中的复现。## 公开发布范围 本仓库仅包含可安全公开共享的材料:— 分析脚本;— 校准脚本;— LLM评分脚本;— 提示词/评分标准文本;— 配置模板;— 小型样本输入表格;— 小型样本输出表格。本仓库不包含:— 原始数据(ori)

yanyuelin721
2026/03/29
论文
arXiv
GeoAI
GIS
跨模态城市感知:评估街景与航拍影像中的声-视对齐性
Cross-Modal Urban Sensing: Evaluating Sound-Vision Alignment Across Street-Level and Aerial Imagery

环境声景蕴含大量关于城市生态与社会状况的信息,但其在大规模地理分析中的潜力尚未得到充分挖掘。本研究通过比较多种视觉表征策略在捕捉声学语义方面的能力,探究城市声音与视觉场景之间的对应程度。我们采用多模态方法,将地理编码的声学录音与街景影像及遥感影像相结合,覆盖伦敦、纽约和东京三座全球主要城市。音频端采用AST模型,影像端分别采用CLIP与RemoteCLIP模型,语义分割则使用CLIPSeg与Seg-Earth OV模型;基于这些模型提取嵌入向量与类别级特征,以评估跨模态相似性。结果表明,街景影像嵌入与环境声音的对齐性优于分割输出;而遥感影像分割在Biophony–Geophony–Anthrophony(BGA)框架下对生态类别的解释能力更强。这些发现表明,基于嵌入的模型在语义对齐方面表现更优,而基于分割的方法则能提供视觉结构与声学生态之间可解释的关联。本工作通过为地理空间分析中融入声音数据提供新视角,推动了新兴的多模态城市感知领域的发展。

Pengyu Chen, Xiao Huang, Teng Fei
2025/06/04
论文
arXiv
GeoAI
GIS
跨模态城市感知:基于街景与航拍影像评估声觉-视觉的一致性
Cross-Modal Urban Sensing: Evaluating Sound-Vision Alignment Across Street-Level and Aerial Imagery

环境声景蕴含丰富的城市生态与社会信息,但在大规模地理分析中的潜力尚未得到充分挖掘。本研究通过比较多种视觉表征策略在捕捉声学语义方面的表现,探究城市声音与视觉场景之间的对应关系。研究整合了三个全球主要城市(伦敦、纽约、东京)的地理定位声学记录与街景及遥感影像,采用AST模型处理音频,CLIP与RemoteCLIP处理图像,并利用CLIPSeg和Seg-Earth OV进行语义分割,提取嵌入向量与类别级特征以评估跨模态相似性。结果表明,街景嵌入相较于分割输出与环境声音具有更强的一致性,而遥感影像的分割结果在基于生物声—地质声—人类声(BGA)框架下对生态类别的解释更具优势。研究发现表明,基于嵌入的模型在语义对齐方面表现更优,而基于分割的方法则提供了视觉结构与声景生态之间可解释的关联。本研究推动了多模态城市感知领域的进展,为将声音融入地理空间分析提供了新视角。

Pengyu Chen, Xiao Huang, Teng Fei
2025/06/04
论文
Nature
PaperDiscovery
城市视觉-空间智能:融合人类与传感器感知以促进可持续城市发展 | npj Urban Sustainability
Urban visual-spatial intelligence: linking human and sensor perception for sustainable urban development | npj Urban Sustainability

理解城市感知有助于推进城市智能研究,从而支持可持续发展与智慧城市建设。城市视觉-空间智能(UVSI)整合了人类感知与传感器感知。本文综述探讨了UVSI在可持续发展中的潜在作用,识别了当前研究空白,并提出了未来优先研究方向。人工智能、高性能计算、实时数据处理及公民科学等领域的进展可能对UVSI产生重大影响。

2025/08/12
论文
arXiv
GeoAI
GIS
街景影像与公众参与地理信息系统是否一致:城市吸引力的比较分析
Do Street View Imagery and Public Participation GIS align: Comparative Analysis of Urban Attractiveness

随着数字工具日益影响空间规划实践,理解不同数据源如何反映人类对城市环境的体验至关重要。街景影像(SVI)与公众参与地理信息系统(PPGIS)是两种捕捉场所感知的代表性方法,可支持城市规划决策,但二者之间的可比性仍缺乏深入研究。本研究探讨了芬兰赫尔辛基市基于街景影像的感知吸引力与通过全市范围PPGIS调查获取的居民实际体验之间的匹配程度。利用参与者评分的街景影像数据和语义图像分割技术,我们训练了一个机器学习模型,以视觉特征预测感知吸引力。将模型预测结果与PPGIS识别出的吸引或不吸引地点进行对比,并采用严格和适度两套标准计算一致性。研究发现,两类数据集之间仅存在部分一致性。在适度阈值下,吸引性地点的一致性为67%,非吸引性地点为77%;而在严格阈值下,一致性分别降至27%和29%。通过分析包括噪声、交通、人口密度及土地利用在内的多种情境变量,我们发现非视觉因素显著导致了不一致。该模型未能涵盖活动水平和环境压力等影响感知但无法在图像中体现的体验维度。结果表明,尽管街景影像可作为城市感知的可扩展且可视化的代理指标,但无法完全替代PPGIS所捕捉的丰富体验。我们认为,两种方法各有价值,但功能不同,因此需要更整合的方法以全面捕捉城市感知。

Milad Malekzadeh, Elias Willberg, Jussi Torkko
2025/11/04
1 / 29