近期研究重心从传统的静态路径规划转向基于强化学习(RL)与大语言模型(LLM)的动态自适应控制及预测,强调在复杂约束下的实时决策能力。方法论上呈现出“空间智能增强”与“可解释性保障”并行的趋势,即通过引入地理空间约束修正LLM的空间推理缺陷,并建立针对生成式AI输出的安全信任层。
方向趋势板
每张卡片代表一个当前值得单独跟踪的研究方向,包含趋势摘要、证据化信号、反复出现的核心观点,以及可以回看的原始条目。
近期研究重心从传统的静态路径规划转向基于强化学习(RL)与大语言模型(LLM)的动态自适应控制及预测,强调在复杂约束下的实时决策能力。方法论上呈现出“空间智能增强”与“可解释性保障”并行的趋势,即通过引入地理空间约束修正LLM的空间推理缺陷,并建立针对生成式AI输出的安全信任层。
大规模工业机器人车队共享受限的物理基础设施,导致车辆通行时间受安全间距、路口访问权、下游阻塞及站点争用等因素影响。本文以洁净室半导体制造厂中典型的天花板式物料搬运系统——天车搬运系统(Overhead Hoist Transport, OHT)为研究对象。静态最短路径路由无法刻画这些时变交通成本;而表格型Q路由(tabular Q-routing)虽可在线自适应,但其对每个“目标节点–动作”组合独立学习Q值,限制了稀疏访问路由场景间的信息共享,且初始行为易受不准确Q值估计的影响。为此,我们提出神经双Q路由(Neural Double Q-routing),以共享的状态–动作价值网络替代按目标索引的表格。该网络通过在混合仿真生成的路由轨迹上执行“剩余回报回归”(return-to-go regression)进行冷启动预训练,并进一步结合双Q更新、局部拥塞校正及事件分层结构化重放机制进行在线优化。在九组匹配的车队规模–到达率设置下(含100、150与200台OHT),所提框架相较表格型双Q路由将平均任务完成时间降低0.8%–8.8%。在全部六组150台与200台OHT设置中,其平均完成时间均为所有对比方法中最低;而在三组100台OHT设置中,Dijkstra算法仍表现最优。在九组设置中的八组中,其完成任务数与表格型双Q路由的差异控制在1%以内;八组设置中其95百分位完成时间亦有所下降。在两种匹配的启动场景下,离线初始化使完成任务数最多提升23%,尾部完成时间最多降低15%。
城市交通拥堵在以汽车为主导的城市中仍是长期存在的挑战,带来显著的经济与社会成本。交通信号系统正日益作为网络化信息物理系统组件部署于智慧城市基础设施中,分布式感知与边缘智能支撑了自适应交通管理。本文研究强化学习(RL)作为一种边缘智能方法,用于科威特某信号控制城市交叉口的自适应交通信号运行。本文设计了一种基于近端策略优化(PPO)的控制器,仅依据本地观测到的交通状态动态分配绿灯时长,无需未来交通需求信息或中心化协调。该控制器在基于科威特真实小时级交通流量数据构建的高保真仿真环境中进行评估,并以平均车辆延误、排队长度和排放量为性能指标,与传统定时控制及代表当前工程实践的车辆感应式控制器进行对比。在基准工况下,所提控制器相较定时控制降低平均车辆延误46%,相较感应式控制降低34%,同时使单车CO2排放量减少约23%。上述性能优势在交通需求波动±15%条件下依然保持,可从工作日交通模式泛化至周末模式,并经奖励函数消融实验验证;五组随机种子实验结果方差较低,证实其统计可靠性。本研究结果表明,基于学习的边缘交通信号控制具备实际应用价值,可作为物联网赋能的智慧城市交通系统的构建模块,并为全面互联的车联网(IoV)系统提供可部署的前期技术路径。
大都市区正同步推进多项干预措施,以提升交通流动性、可达性及能源效率,亟需集成化工具来理解这些政策如何相互作用,进而影响出行行为、能源消耗及基础设施需求。本文以‘照常情景’(BAU)为基准,评估电气化、货运需求管理、道路收费、停车改革及公共交通扩展等政策组合对2050年芝加哥大都市交通系统的综合影响。我们采用POLARIS——一个基于2019年条件校准的大规模智能体建模框架,在伊利诺伊州东北部七县区域模拟九种政策情景。该框架协同模拟基于活动的客运需求、内生性货运生成、多模式交通分配及公共交通运营,并针对各情景优化充电基础设施布局与货运作业。研究发现:在高电气化情景下,总燃料质量较BAU下降68%,而总充电能耗则增至BAU的约4–8倍,峰值电力需求接近4 GW,且高度集中于城市核心区;货运管理政策通过增加货运行程频次但缩短单程距离,降低了货运车辆行驶里程(Freight VMT);智能道路收费对降低小汽车车辆行驶里程(Auto VMT)效果最为显著;公共交通扩展使客运量较BAU提升18%。本研究首次为芝加哥地区构建了集成式、基于智能体的情景分析框架,联合评估上述多项干预措施,为区域交通规划、电网基础设施投资及减排目标实现提供了可操作的决策依据,并凸显了针对性充电桩升级与政策组合协同实施的重要价值。
预测用户的下一个兴趣点(POI)是人类移动性建模中的一项任务,然而基于大语言模型(LLM)的方法侧重于从既往移动记录中进行语义推理,却忽视了现实世界的空间上下文。事实上,人类移动性本质上受空间认知的影响,包括地理距离和邻域上下文。此外,已有证据表明LLM在空间推理任务(如距离估计和具有地理偏差的预测)中往往表现不佳,这进一步加剧了上述问题。为解决这些局限性,我们提出了一个多智能体LLM框架,将下一POI预测分解为三个阶段:首先,模式提取智能体从轨迹历史中捕捉时间和类别移动模式;其次,空间推理智能体通过结合行为偏好与现实世界空间约束(包括地理距离、路网距离和邻域归属)来构建候选活动选择;最后,决策综合智能体整合行为模式和空间推理以进行最终预测。在NYC基准数据集上使用两种LLM骨干网络进行的实验显示,该方法优于基线方法,Hit@1提升高达493%,Hit@5相对提升37%。消融实验表明,将邻域归属与基于距离的特征相结合通常优于仅使用距离的设置,且空间推理智能体通过将行为偏好与现实世界空间约束相结合,在最终预测中起着关键作用,尤其对于较小规模的模型而言。总体而言,结果凸显了空间推理在移动性预测中的重要性。准确的下一POI预测需要将行为模式与明确的现实世界空间约束相结合。
生成式人工智能正日益被非正式地应用于空中交通管理(ATM)中的飞行计划生成、航迹解读和约束检查等任务。尽管这些工具能够减轻工作负荷并加速规划,但其非确定性输出在人机协同环境中带来了安全和运行风险。本文提出了 AI 信任与保障层(ATAL),这是一种模型无关的决策保障架构,用于评估 AI 生成的飞行计划输出是否具备足够的可靠性以投入实际运行。ATAL 结合了提示词变化下的语义稳定性、结构化输出的运行一致性以及针对领域规则的规范性约束验证,并将这些信号映射为供人类操作员参考的决策就绪等级(DRL)。一项受 ATM 启发的实验研究表明,该框架能够在影响飞行计划验证或执行之前,识别出不安全、不一致或具有误导性的输出。尽管在航空领域进行了演示,但该框架同样可迁移至其他需要在监管约束下进行人工监督的安全关键型决策支持领域。
城市交通拥堵是日益严重的全球性问题,显著延长通勤时间并加剧环境污染。传统交通信号控制系统往往难以适应动态变化的交通状况。自适应交通信号控制可在不改变道路基础设施的前提下改善城市交通。深度强化学习(DRL)在此任务中展现出优异性能,但现有基于延误或排队长度的奖励函数常导致短视或不稳定的策略。本文提出一种基于动量的奖励函数(MBRF),旨在鼓励车辆持续通行,而非仅惩罚拥堵。该方法在SUMO(Simulation of Urban MObility)仿真平台中进行评估,采用标准交通指标,包括等待时间、排队长度、通行量及CO2排放量。结果表明,相较于基于延误或排队长度的奖励函数以及经典控制器(如Max Pressure和LQF),所提出的奖励函数可实现更优的通行量-排放权衡,并表现出更稳定的训练行为。
近期研究重心从单纯的视觉模态互补融合,转向引入文本等非视觉数据以弥合语义鸿沟,并深度结合基础模型(Foundation Models)进行参数高效适配。方法论上,正由全量微调向令牌剪枝、低秩适应(LoRA)等轻量化及开放词汇理解方向演进,以解决高分辨率遥感数据的计算瓶颈与泛化性问题。
多模态遥感图像的语义分割在土地利用/土地覆盖(LULC)制图、环境监测及精准地球观测中发挥着关键作用。当前多模态方法主要集中于融合互补的视觉模态,却忽视了非视觉文本数据这一富含知识的信息源——文本可有效弥合视觉模式与现实世界概念之间的语义鸿沟。为解决该局限,我们提出TSMNet:一种文本监督的多模态开放词汇语义分割网络,通过协同整合文本监督与视觉表征实现开放词汇语义分割。不同于传统多模态分割框架,TSMNet引入双分支文本编码器,从多种文本数据中分别提取场景级语义与物体级标签信息,从而支持动态跨模态融合。这些由文本导出的特征通过所提出的文本引导视觉语义融合模块与视觉嵌入动态交互,实现领域感知的特征优化及人类可解释的决策过程。为验证本方法,我们创新性地构建了两个新的多模态数据集,并开展大量实验,将所提方法与其它前沿(SOTA)语义分割模型进行系统性对比。结果表明,TSMNet在分割精度上表现优越,且在多样化的地理区域与传感器特异性场景中展现出强泛化能力。本工作为可解释遥感分析建立了新范式,证实文本知识整合可显著提升模型泛化性。源代码将于https://github.com/yeyuanxin公开。
出版日期:2026年9月;来源:《国际应用地球观测与地理信息学杂志》(International Journal of Applied Earth Observation and Geoinformation),第153卷;作者:李浩成、郑珏鹏、苗爽熙、卢瑞博、蔡国胜、傅昊桓、黄建熙
出版日期:2026年11月;来源:《ISPRS Journal of Photogrammetry and Remote Sensing》,第241卷;作者:唐浩钧、赵文达、崔恒帅、王海鹏
数十年来的轨道探测任务已获取大量月球多模态遥感数据,涵盖光学影像、光谱学、热辐射、雷达、重力场及元素成分等类型。然而,这些数据仍分散存档于不同机构,且尚无用于评估机器学习模型在月球数据上性能的基准。本文提出 Moonstone,首个面向月球遥感的多模态基础模型基准。我们的贡献包括:(1)构建一个覆盖五项任务、七类仪器的全球月球预训练数据集,包含28个通道、空间分辨率为每度128像素(约237米);(2)提出 MG-MAE(Modality-Grouped Masked Autoencoder),一种按模态分组的掩码自编码器,其特点包括:针对各模态组设计的卷积标记器(convolutional tokenizers)、共享的 Vision Transformer 编码器、面向缺失模态的注意力掩码(attention masking)、适配异构空间覆盖范围的覆盖率自适应掩码(coverage-adaptive masking),以及保障物理合理重建的光谱连续性正则化(spectral continuity regularization);(3)构建涵盖分类、回归与分割任务的六项下游任务基准。MG-MAE 预训练特征在全部下游任务上均显著优于从零训练(scratch)基线,并大幅超越 ImageNet 预训练及标准 MAE 基线。数据与代码发布于 https://huggingface.co/datasets/ayushprd/Moonstone 和 https://github.com/ayushprd/Moonstone。
多模态变化检测(MMCD)旨在从多模态遥感(RS)数据中识别变化区域,在土地利用监测、灾害评估及城市可持续发展等领域具有重要应用价值。然而,现有MMCD方法在跨模态交互与模态特异性特征挖掘方面存在局限,导致对细粒度变化信息建模不足,难以精准检测多模态数据中的语义变化。为解决上述问题,本文提出STSF-Net——一种面向光学与合成孔径雷达(SAR)图像的MMCD框架。STSF-Net联合建模模态特异性特征与时空共性特征,以增强变化表征能力:模态特异性特征用于捕获真实的语义变化信号,而时空共性特征则用于抑制由成像机制差异引发的伪变化。此外,我们引入一种光学与SAR特征融合策略,该策略依据预训练基础模型提取的语义先验,自适应调整各模态特征的重要性,实现语义引导下的多模态信息自适应融合。同时,我们构建了Delta-SN6数据集,这是首个公开可用的多类别MMCD基准数据集,包含甚高分辨率(VHR)全极化SAR与光学图像。在Delta-SN6、BRIGHT和Wuhan-Het数据集上的实验结果表明,本方法在平均交并比(mIoU)指标上分别较当前最优方法(SOTA)提升3.21%、1.08%和1.32%。相关代码与Delta-SN6数据集将发布于:https://github.com/liuxuanguang/STSF-Net。
出版日期:2026年5月;来源:《国际应用地球观测与地理信息学杂志》(International Journal of Applied Earth Observation and Geoinformation),第149卷;作者:王庆鹏、黄舟、程颖、鲍毅
研究重心正从单一地球观测(EO)模态的表征学习,转向融合矢量语义、人类移动性及自然语言交互的多模态自主智能体系统。评估范式亦由单纯追求准确率,转变为关注模型在分布偏移下的校准性、鲁棒性及零样本迁移能力。
应对粮食安全、灾害风险、疾病暴发及社会经济脆弱性等关键全球挑战,亟需高保真度的地理空间建模。然而,构建预测性行星尺度模型仍受限于碎片化的数据生态体系,需人工检索数据、多模态数据整理与融合,以及迭代式模型选择。本文提出行星预测引擎(Planetary Prediction Engine, PPE),一种可直接响应自然语言查询、执行端到端工作流的自主人工智能系统。PPE 动态合成多模态数据集,从开放网络与地球观测平台(如 Data Commons、Google Earth Engine)中检索时空相关的协变量,并将其与地理空间基础模型嵌入(PDFM、AlphaEarth)相融合;同时,在任务定制的模型架构族中自动搜索最优模型,并内置防止过拟合机制。在涵盖不同任务、地理区域与科学领域的广泛评估中,PPE 始终优于当前最优方法或人工调优的专家基线模型。在美国空间回归任务中,PPE 在21项美国疾控中心(CDC)健康指标上的平均 $R^2$ 达76.8%(基线为60.0%),在联邦应急管理局(FEMA)国家风险指数上达64.9%(基线为60.0%),在社会脆弱性指数(Social Vulnerability Index)上达66.2%(基线为58.6%)。在数据稀缺场景下的空间降尺度任务中,PPE 通过整合本地化代理变量,将尼日利亚粮食安全指标的基线准确率提升一倍($R^2$ 达66.1%,基线为31.5%)。在2026年刚果民主共和国布恩迪布戈埃博拉疫情的流行病学即时预测任务中,PPE 实现 Recall@10 为83.3%(在五次周度预测中识别出18个新入侵卫生区中的15个),较当前公开最优建模方法提升10.3个百分点(约73%)。通过将自主多模态行星数据发现与定向模型优化相结合,PPE 降低了……
地理空间基础模型(GFMs)正成为学习语义丰富且地理一致的视觉与物理表征的一种强大范式。然而,其对地球观测(EO)数据的依赖导致人类活动相关信息在很大程度上未被充分表征。人类移动数据揭示了区域间功能与关系结构,而此类信息在EO数据中缺失;但该类数据通常仅覆盖单一城市,因而难以用于可迁移的城市表征学习。本文提出MoRAX——一种轻量级框架,用于将源自人类移动性的功能结构融入地理空间嵌入。MoRAX在保持GFM覆盖范围与一致性的同时,提供城市区域间功能连通性信息,从而支持零样本部署于未见城市,无论目标城市是否具备可用的移动数据。在横跨两个国家的四座目标城市上,观察移动数据的MoRAX教师模型在八项社会经济与环境预测任务中持续优于GFMs及强城市表征基线模型。与此同时,从不以移动数据为输入的学生模型在多数任务中性能接近教师模型。跨国家的迁移结果进一步表明,以移动流为条件的调制机制为将地理空间基础模型锚定于城市的人本维度提供了一种通用途径。
地理空间基础模型(GeoFMs)通常仅依据其在标准基准条件下的准确率(通过平均排名)进行排序与选择。本文指出,该评估范式过于狭窄:面向关键地球观测(EO)任务的实际部署,亟需引入额外分析维度,尤其是校准性(calibration),即模型置信度与其预测正确性之间的一致性。我们在16个冻结编码器、4个分类数据集与5个分割数据集、以及两条正交压力轴上开展实验,结果表明:所有编码器均随扰动强度增加而性能下降,且其相对排名亦随之变化。在4个分类基准上,地球观测预训练(EO-pretrained)与ImageNet预训练编码器在干净数据上的准确率与校准性均无显著差异;EO预训练并未比ImageNet预训练提供更强的分布偏移鲁棒性。在分布偏移下,GeoFMs在每一扰动等级及每一类扰动家族中均较ImageNet预训练编码器表现出更严重的过度自信倾向。中心化核对齐(CKA)分析揭示了这一现象的表征根源:EO预训练嵌入在扰动下表征刚性更强(变化更小),但任务信息损失程度相当,且仍维持过度自信状态。我们测试了三种常用不确定性量化方法,发现温度缩放(temperature scaling)与深度集成(deep ensembles)均无法缓解该退化现象;而高斯过程探针(Gaussian-process probe)仅在严重云覆盖扰动下将预期校准误差(ECE)约降低一半,却以干净数据上ECE翻三倍为代价。在选择性预测(selective prediction)实验中,我们发现基于置信度的拒绝机制无法有效规避高置信度错误预测。因此,我们主张:基准测试的排名与评估应覆盖多种条件与指标,以更全面地衡量模型研发进展,并缩小与真实世界部署场景之间的差距。
地球观测(Earth Observation, EO)已从根本上改变了对环境过程和人类活动的全球尺度监测。近期自监督学习的发展催生了地球观测基础模型(Earth Observation Foundation Models, EOFMs),该模型利用PB级未标注EO数据,学习可迁移表征,以支持广泛下游地理空间任务。尽管取得进展,当前EOFMs仍主要局限于栅格模态,忽视了OpenStreetMap与Overture等公开可获取矢量数据源中蕴含的丰富结构化信息。矢量数据以显式且紧凑的方式表征地理实体,涵盖几何、拓扑及语义关系,提供了影像本身常难以明确表达或无法获取的关键上下文信号。因此,栅格与矢量数据代表了地理空间的互补视角:栅格数据捕获连续的物理与光谱模式,而矢量数据则编码离散对象及其关系结构,且往往更侧重于人类系统(如社会或人口统计学数据),而非纯物理系统。然而,现有地理空间表征学习范式将这两种模态割裂处理,依赖不完善且常具信息损失的转换方法来弥合二者。本文作为观点论文,呼吁转向一种新范式——联合空间表征学习(Spatial Representation Learning, SRL),即在统一嵌入空间中整合栅格感知与基于矢量的推理。我们基于多模态地理空间学习的新兴进展,阐述其概念基础、技术挑战以及融合异构空间数据源的潜在路径,并主张此类融合对于构建下一代地理空间基础模型至关重要。
尽管存在其他替代方案(例如 space2vec),但其效率较低、表达能力较弱,且在人工智能时代更难与大型模型集成。其次,地理空间基础模型(GeoFM)的发展可能为解决可迁移性挑战提供潜在方案。
卫星基础模型为通勤起讫地(OD)生成任务提供了全球可获取的普查数据替代方案,但尚无研究在统一下游任务流程中系统比较不同编码器范式。我们在相同的WeDAN图扩散框架下,对四种卫星视觉编码器——语言监督型(RemoteCLIP)、自监督型(DINOv3)及地理感知型(SatCLIP、AlphaEarth)——开展消融实验,覆盖1925个美国县、325个英国行政区及14个全球城市,并在五个随机种子下进行评估。主要发现有三:第一,语言监督特征在分布内性能最强(RemoteCLIP的CPC为0.602),而地理感知编码器零样本迁移更稳健:AlphaEarth在英国行政区上的CPC较RemoteCLIP提升33%;第二,预训练语料规模本身并不充分:DINOv3虽在更大规模卫星语料上训练,其分布内CPC仍比RemoteCLIP低0.091,且在全球范围内坍塌至CPC 0.022;第三,所有编码器均无法有效迁移至全球城市(RemoteCLIP最佳CPC为0.122,DINOv3为0.022),证实跨洲OD生成仍是开放问题。此外,我们厘清了人口普查噪声参数$η$的语义:其排序在跨洲评估中发生反转,该差异对正确解读既有结果至关重要。训练脚本与评估日志将开源发布。
近期研究重心从静态拓扑结构评估转向动态级联失效机制及多模态交通网络的系统性风险量化。方法论上,元胞自动机(Cellular Automata)的应用边界正从传统空间模拟向经济学理论重构及抽象群论数学性质刻画延伸,同时开源卫星软件生态成为支撑地球观测仿真的新兴关注点。
设 $G$ 是一个群,$\mathbb{K}$ 是一个域,$V$ 是一个 $\mathbb{K}$-向量空间。我们证明:存在一个双射的线性元胞自动机 $V^G \to V^G$,其逆映射不是元胞自动机,当且仅当 $G$ 不是局部有限群且 $\dim_{\mathbb{K}}V \geq |\mathbb{K}|^{\aleph_0}$。该结果解决了 T. Ceccherini-Silberstein 与 M. Coornaert 提出的一个公开问题。
出版日期:2026年10月1日;来源:《可持续城市与社会》(Sustainable Cities and Society),第149卷;作者:刘欣、陈颖昕、Russell Thompson、杨雪婷、葛然
现代城市韧性日益受到多模态交通网络系统性风险的挑战,局部扰动可能蔓延并损害系统功能。现有研究已在成对拓扑结构、静态韧性评估及高阶建模方面取得进展,但静态结构能否预测由过载驱动的级联后果仍不明确。
卫星已成为现代技术系统的基础性组成部分,支撑通信、导航、地球观测及科学研究等关键基础设施。随着空间探索的深入和卫星赋能服务需求的增长,对复杂、异构卫星软件的依赖持续增强。因此,系统性理解卫星软件生态愈发重要,但现有研究仍缺乏全面的经验性考察。为弥补这一空白,本文开展了首项针对开源卫星软件的特征刻画研究,对其生态系统与开发实践进行分析。我们通过三个研究问题——流行度趋势(RQ1)、软件目标(RQ2)与开发实践(RQ3)——挖掘并分析了 GitHub 上 22,286 个卫星相关项目。首先,我们刻画了项目数量与活跃开发者数量的时间演化规律,揭示其流行度持续上升的趋势;其次,通过对 646 个项目的人工审查,构建了一个涵盖概念设计、数据集、系统实现、仿真、测试及工具等六大类别的 43 项软件目标分类体系;第三,我们对含源代码的项目展开深入分析,发现该生态系统高度异构且任务高度专业化,共使用 66 种编程语言,并呈现多样化的实现策略。最后,我们总结关键发现,并为卫星开发者与研究人员提出可操作的启示。
本项目旨在通过建造一栋建筑来填补城市空隙,该建筑以邻近建筑的高度、立面退线及建构原则为设计依据。因此,该建筑沿街立面与街道齐平,延续了街道主导的形态特征,但顶层向内退缩,既确保了向北方向的形态连续性,又实现了向南方向的体量过渡。
出版日期:2026年12月;来源:《计算机、环境与城市系统》(Computers, Environment and Urban Systems),第130卷;作者:Liliana Perez、Maryam Yousefi、Navid Mahdizadeh Gharakhanlou、Sinisa Vukicevic、Suzana Dragicevic
围绕实验室五个研究方向整理的研究日报 PDF,包含头版综述、方向趋势与当日延伸阅读。