全局检索与知识浏览
跨论文、博客、数据集线索、项目和工具统一检索。检索结果可以继续跳转到独立问答页,做语义追问和来源核验。
卫星与航空影像分析已随着基础模型的出现进入新纪元。本文阐述了地理空间基础模型(GeoFM)的概念,即通过多种方法在海量地理空间数据集上进行预训练的人工智能/机器学习(AI/ML)模型。我们首先阐明GeoFM所推动的核心范式转变:职责分离——大规模模型提供商承担计算密集型的预训练任务,使领域专家能够快速对这些模型进行微调或提示工程,以完成特定的关键任务。该方法在保障下游任务安全性与保密性的同时,实现了前沿AI/ML技术的普惠化访问。随后,我们探讨不同类GeoFM所解锁的新能力,区分由掩码自编码等自监督技术生成的可微调视觉模型,与由对比学习生成的视觉-语言模型;后者支持零样本任务,例如开放词汇图像分析。接着,我们讨论GeoFM实际部署中的关键考量因素,涵盖性能-成本分析及更广泛的MLOps生态系统。为此,我们提出一种模型适配策略分类法,并构建一个框架,协助领域专家为其特定任务集选择最具成本效益的适配方法。最后,我们展望“智能体地理空间推理”(Agentic Geospatial Reasoning)的未来图景:大型语言模型(LLM)作为智能编排器,将GeoFM作为工具,以自然语言响应高层用户查询,并自动化复杂的分析工作流,推动该领域从感知迈向认知。
GISclaw——一个面向全栈地理空间分析的开源大语言模型(LLM)驱动智能体系统。本 GitHub 仓库由开发者 geumjin99 维护,最后更新时间为 2026-03-27。🚧 即将发布 🚧 论文录用后,将公开源代码、评估脚本及基准测试结果。
我们对NASA与IBM联合开发的Prithvi-EO-2.0地理空间基础模型在利用卫星影像进行小型沙质岛屿海岸线提取方面的表现进行了初步评估。我们收集并标注了来自马尔代夫两个岛屿的225幅多光谱图像数据集,并公开发布该数据集;同时,我们在包含5至181幅图像的训练子集上对Prithvi模型的300M和600M参数版本进行了微调。实验结果表明,即使仅使用5幅训练图像,模型仍能取得优异性能(F1值为0.94,IoU值为0.79)。研究结果展示了Prithvi模型强大的迁移学习能力,凸显了此类模型在数据匮乏地区支持海岸带监测的巨大潜力。
亟需能够处理各类数据源、其模态以及不同空间与时间分辨率的策略与工具。过去几十年间,深度学习的兴起与计算能力的增长,已彻底改变了遥感(EO)数据的处理方式,其应用涵盖地球系统科学、城市计算、地理空间语义学和遥感等领域。
多模态推理的最新进展使得智能体能够解析图像、将其与语言关联并执行结构化分析任务。然而,将此类能力扩展至遥感领域仍具挑战性,因为模型需在空间尺度、地理结构及多光谱指数等维度上进行推理,同时保持连贯的多步逻辑。为弥合这一差距,OpenEarthAgent提出了一种统一框架,用于开发基于卫星影像、自然语言查询及详细推理轨迹训练的工具增强型地理空间智能体。该训练流程依赖于结构化推理轨迹上的监督微调,使模型在多样分析场景中与经验证的多步工具交互对齐。配套语料库包含14,538个训练实例和1,169个评估实例,训练集包含超过10万次推理步骤,评估集超过7,000次推理步骤。数据覆盖城市、环境、灾害及基础设施领域,并整合了基于GIS的操作以及NDVI、NBR和NDBI等指数分析。基于显式的推理轨迹,所学智能体展现出结构化推理能力、稳定的空间理解力以及在不同条件下通过工具驱动的地理空间交互所呈现的可解释行为。实验结果表明,该方法在强基线基础上实现了持续改进,并在性能上与近期开源及闭源模型相当。
探讨地理空间基础模型的现状,涵盖表征学习到人口动态等主题,并汇总CARTO与巴塞罗那超级计算中心(BSC)联合举办的研讨会见解。
滑坡对生命、基础设施和环境造成严重破坏,因此准确及时的制图对于灾害预防与应对至关重要。然而,传统深度学习模型在应用于不同传感器、区域或训练数据有限的情况下往往表现不佳。为应对这些挑战,我们提出一个涵盖传感器、标签和领域三个维度的分析框架,用于适应地理空间基础模型(GeoFMs),重点聚焦于Prithvi-EO-2.0在滑坡制图中的应用。通过一系列实验,我们发现该模型在性能上持续优于任务特定的卷积神经网络(U-Net、U-Net++)、视觉Transformer(Segformer、SwinV2-B)以及其他GeoFMs(TerraMind、SatMAE)。该模型基于全球预训练、自监督学习以及可适应的微调机制,在面对光谱变化时表现出鲁棒性,即使在标签数据稀缺条件下仍能保持较高精度,并在多种数据集和地理环境中展现出更可靠的泛化能力。与此同时,我们也指出了仍存在的挑战,如计算成本较高以及可用于滑坡研究的可复用AI就绪训练数据有限。总体而言,本研究将GeoFMs定位为实现更稳健、可扩展的滑坡风险减缓与环境监测方法的重要一步。
在大数据时代,基于云边协同数据的智能教学空间模型构建是当前教育创新探索的重点。在理解构建模型的基础上,依托云边协同数据的安全存储体系,本文深入探讨了该技术的实现路径,并最终获得相关成果。
多模态推理的近期进展催生了能够解析图像、关联语言并执行结构化分析任务的智能体。然而,将此类能力拓展至遥感领域仍具挑战性,因模型需在空间尺度、地理结构及多光谱指数之上进行推理,同时保持连贯的多步逻辑。为填补这一空白,我们提出 \textit{OpenEarthAgent}——一个面向工具增强型地理空间推理的统一框架,其训练数据涵盖卫星影像、自然语言查询及结构化推理轨迹。OpenEarthAgent 不仅作为基准测试集,更构建了一套以统一可执行工具注册表与基于轨迹的策略学习为核心的连贯智能体架构。该框架将异构的视觉、光谱、GIS 及地理配准栅格操作标准化为一致的可调用接口,支持模块化编排与确定性执行。训练采用监督微调方式,在结构化推理轨迹上进行,并辅以确定性回放验证,以确保可执行性与空间正确性。配套语料库包含 14,538 个训练样本与 1,169 个评估样本,总计逾 107,000 个推理步骤,覆盖城市、环境、灾害与基础设施等领域,并整合 GIS 操作及 NDVI、NBR、NDBI 等指数分析。基于显式推理轨迹训练所得智能体,在多样化地球观测(EO)场景中展现出结构化推理能力、稳定的空间理解能力以及可解释的工具驱动行为。实验表明,本方法在强基线模型上实现持续性能提升,并在近期开源与闭源模型中具备竞争力。代码、数据及预训练模型均已公开:https://github.com/mbzuai-oryx/OpenEarthAgent
由大语言模型(LLM)驱动的地理空间人工智能(GeoAI)正通过自然语言接口及具身式自主地理信息系统(GIS)工作流,拓展对空间信息的查询、生成与解释能力。这一能力引发了一系列治理挑战,而通用人工智能伦理讨论尚无法充分涵盖这些挑战,包括从移动轨迹中被动推断位置、受空间自相关性与尺度效应驱动的空间结构化偏见放大、空间事实幻觉,以及多模态地理空间输入中不确定性逐级累积等问题。本叙事综述识别出LLM赋能GeoAI中八类反复出现的问题:数据来源与知情同意、空间隐私与推断风险、算法偏见与空间不公、作为空间结构性风险的空间机制(空间自相关性、可修改区域单元问题及尺度效应)、LLM特有的技术风险、可解释性、政策与监管缺口、公众赋能与人才队伍建设。针对每一问题,我们阐释其底层机制,援引文献中的典型实例予以佐证,并评估当前技术或制度响应的进展状态,范围涵盖基本未被触及、正处于积极辩论之中,或已纳入新兴政策议程。基于该综合分析,我们提出一种面向治理感知的LLM赋能自主GIS架构,将上述每类问题映射至地理空间数据全生命周期中可执行的管控措施与可审计的产出物,并以一个洪水响应路径规划的实际案例予以说明。综述指出一项持续存在的证据缺口:现有应对方案大多仍停留于概念层面,针对LLM赋能GeoAI的治理管控措施尚缺乏经实地验证的评估。最后,我们提出一项强调实证验证的研究议程。
随着城市化进程和气候变化的推进,城市热岛效应日益频繁且加剧。为制定有效的缓解策略,城市需要详细的气温数据。然而,基于传统机器学习模型和有限数据基础设施的预测分析方法在欠覆盖区域常导致不准确的预测。在此背景下,基于全球非结构化数据训练的地理空间基础模型展现出强大的泛化能力,且仅需极少微调,为传统方法受限的场景提供了替代方案。本研究对地理空间基础模型进行微调,以预测未来气候情景下的城市地表温度,并通过模拟植被策略探讨其对土地覆盖变化的响应。微调后的模型像素级下采样误差低于1.74 °C,且与地面实测模式一致,表现出最高达3.62 °C的外推能力。
多模态推理的近期进展推动了能够解析图像、关联语言并执行结构化分析任务的智能体的发展。然而,将此类能力拓展至遥感领域仍具挑战性,因为模型需在空间尺度、地理结构及多光谱指数等维度上进行推理,同时保持连贯的多步逻辑。为填补这一空白,我们提出 \textit{OpenEarthAgent}——一个面向工具增强型地理空间推理的统一框架,其训练数据涵盖卫星影像、自然语言查询及结构化推理轨迹。OpenEarthAgent 不仅作为基准测试集,更构建了一种凝聚的智能体架构,核心包括统一的可执行工具注册表与基于轨迹的策略学习机制。该框架将异构的视觉、光谱、GIS 及地理配准栅格操作标准化为一致的可调用接口,从而支持模块化编排与确定性执行。训练采用监督微调方式,以结构化推理轨迹为输入,并通过确定性回放验证确保可执行性与空间正确性。配套语料库包含 14,538 个训练样本与 1,169 个评估样本,总计逾 107,000 个推理步骤,覆盖城市、环境、灾害与基础设施等领域,并整合 GIS 操作及 NDVI、NBR、NDBI 等指数分析。依托显式推理轨迹,所学智能体在多样化地球观测(EO)场景中展现出结构化推理能力、稳定的空间理解能力以及可解释的工具驱动行为。实验表明,该方法在强基线模型基础上实现持续性能提升,并在近期开源与闭源模型中展现出竞争力。代码与预训练模型将公开发布。
地理空间基础模型(GeoFM)有望为地球观测(EO)任务提供广泛的泛化能力,尤其在数据受限条件下表现突出。然而,其庞大的模型规模对资源受限的航天器硬件部署构成挑战。为此,我们提出了一种基于视觉Transformer(ViT)的GeoFM紧凑型变体,在保持下游任务性能的同时实现了机载执行。通过对五个下游任务的评估以及在两种典型飞行环境中的验证,表明模型压缩与领域适应对于降低模型尺寸和资源需求、同时在实际运行条件下维持高性能至关重要。我们进一步展示了在国际空间站搭载的IMAGIN-e有效载荷上实现的可靠在轨推理。这些结果确立了从大型GeoFM到可飞行、资源高效的部署路径,拓展了地球观测任务中机载人工智能的可行性。
基于 Google Agent Developer Kit (ADK) 构建的 AI 驱动地理空间分析平台。v16.0 版本实现 SIGMOD 2026 定义的 L3 级自主智能体能力,涵盖语义算子、多智能体协作、错误恢复、防护机制(guardrails)、遥感分析、工具演化及 AI 技能创建。包含 2966 余项测试用例,完整实现《Agentic Design Patterns》所列全部 21 种设计模式。涉及主题包括 agentic-design-patterns、ai-agent、autonomous-agent、chainlit、data-fusion、deep-reinforcement-learning。本 GitHub 仓库由开发者 zhouning 维护,主要编程语言为 Python,GitHub Star 数为 9,最后更新时间为 2026-04-01。
基础模型(FMs)是大规模预训练的人工智能(AI)系统,已在自然语言处理与计算机视觉领域引发变革,并正推动地理空间分析与地球观测(EO)的发展。此类模型有望提升跨任务泛化能力、可扩展性,并以极少标注数据实现高效适配。然而,尽管地理空间基础模型迅速涌现,其在现实世界中的实用性及其与全球可持续发展目标(SDGs)的契合度仍缺乏深入探究。本文提出SustainFM——一个植根于17项可持续发展目标的综合性基准评估框架,涵盖从资产财富预测到环境灾害检测等高度多样化的任务。本研究对地理空间基础模型开展了严谨的跨学科评估,为其在实现可持续发展目标中的作用提供了关键洞见。主要发现包括:(1)尽管并非在所有场景下均具普适优势,基础模型在多种任务与数据集上常优于传统方法;(2)对基础模型的评估不应仅限于准确性,还应将迁移能力、泛化能力与能效作为负责任应用的关键指标;(3)基础模型可支撑可扩展、以可持续发展目标为锚点的解决方案,在应对复杂可持续发展挑战方面具有广泛适用性。尤为重要的是,我们倡导从以模型为中心的研发范式转向以实际影响为导向的部署范式,并强调能效、对领域偏移的鲁棒性及伦理考量等指标。
洪水易发性制图(FSM)对于灾害预防至关重要,但在缺乏数据的地区仍具挑战性,因为水动力模型需要密集的地球物理输入。本文提出ZeroFlood,一种用于数据高效洪水易发性制图的地理空间基础模型框架。该方法通过基于模态思维(TiM)的推理对地理空间基础模型(GFMs)进行微调,实现仅依赖基本地球观测数据(如Sentinel-1或Sentinel-2影像)进行洪水预测。利用数据丰富区域的配对地球观测数据与模拟洪水地图,ZeroFlood通过跨模态表示学习弥合数据差距。基于TerraMind和Prithvi GFMs的实验表明,TiM提升了模型鲁棒性,其中TerraMind-Large配置的F1得分为67.21。结果证明了基于基础模型的FSM在洪水风险管理中具有可扩展性和数据高效性。
出版日期:2026年10月;来源:《ISPRS摄影测量与遥感杂志》(ISPRS Journal of Photogrammetry and Remote Sensing),第240卷;作者:周 Bing、黄 Xiao、王 Siqin、麦 Gengchen、李 Diya、王 Zhangyu、吴 Qiusheng、宁 Huan、王 Junbo、吴 Qifan、贾 Yuhao、王 Ruomei、吕 Shaokun、唐 Bolong、黄 Zixin
表2:数据集构建所用数据源的全面概述,涵盖光学、合成孔径雷达(SAR)、地理信息系统(GIS)及多光谱领域。这些数据源在空间分辨率与标注格式上互为补充,应用范围涵盖城市与交通监测、环境评估及灾害评估,为多传感器、基于工具的地理空间推理提供了丰富的基础支撑。
基础模型(FMs)是大规模预训练的人工智能(AI)系统,已彻底改变自然语言处理和计算机视觉领域,并正推动地理空间分析与地球观测(EO)的发展。它们有望在各类任务中实现更好的泛化能力、可扩展性以及仅需少量标注数据即可高效适应。然而,尽管地理空间基础模型迅速普及,其在现实世界中的实用性及其与全球可持续发展目标的契合度仍缺乏深入探索。我们提出了SustainFM,一个基于17项可持续发展目标的综合性基准测试框架,涵盖从资产财富预测到环境灾害检测等极其多样的任务。本研究对地理空间基础模型进行了严谨且跨学科的评估,为理解其在实现可持续发展目标中的作用提供了关键洞见。研究发现:(1)尽管并非在所有任务中均表现最优,但基础模型通常在多种任务和数据集上优于传统方法。(2)评估基础模型应超越准确率,纳入可迁移性、泛化能力及能源效率等关键指标,以确保其负责任的应用。(3)基础模型能够提供可扩展的、以可持续发展目标为导向的解决方案,广泛适用于应对复杂的可持续性挑战。至关重要的是,我们倡导从以模型为中心的研发转向以影响为导向的部署模式,并强调能源效率、对领域偏移的鲁棒性以及伦理考量等指标的重要性。
《国际地理信息科学杂志》;第39卷;第12期;页码2862-2885;2025年发表;出版机构Taylor & Francis。
一支研究团队在两个在轨平台上成功验证了 NASA 与 IBM 联合开发的开源地理空间人工智能基础模型 Prithvi。
基础模型(FMs)通过大规模预训练在多个领域实现了最先进性能。在地球观测(EO)领域,近年来海量卫星数据档案(拍字节级)的可用性推动了地理空间基础模型(GFMs)的发展。然而,关于数据集规模、模型架构与模型规模如何共同决定下游性能的基本问题仍待解答。本文系统地探索该设计空间,基于三个数据集规模进行模型预训练与微调:PhilEO Globe(0.5TB)、FastTOM(2TB,本文首次提出)以及MajorTOM(23TB)。评估了三种架构族:Geo-Aware U-Net(CNN)、ViT-UPerNet(Transformer)和Mamba(状态空间模型),涵盖参数量从44M到300M的多种模型规模。所有模型均在PhilEO Bench上进行基准测试,任务包括道路密度与建筑密度回归、土地覆盖分割,并与现有GFMs如TerraMind和Prithvi-EO-2.0进行对比。结果表明,在少样本设置下,基于CNN的模型依然具有较强竞争力,其中200M参数的Geo-Aware U-Net在回归任务中优于更大规模的架构。然而,当扩展至拍字节级数据集时,ViT-UPerNet表现最佳,尤其在MajorTOM(23TB)上的语义分割任务中优势显著。最后,我们首次对Mamba模型在地球观测领域的应用进行了广泛评估,凸显其潜在的效率优势,但需进一步的大规模预训练才能完全达到CNN与ViT的性能水平。本文公开发布全部代码、预训练模型及FastTOM数据集,以支持可复现性并促进对GFMs缩放定律的深入研究。
可靠的次国家级人口估计对诸多应用至关重要,但在人口普查数据稀疏、过时或空间分辨率粗糙的地区仍难以实现。现有制图工作流依赖人工构建的地理空间协变量(如聚居区范围、夜间灯光和环境条件),这些变量需跨尺度与跨区域进行组装与标准化。地理空间基础模型则提供了一种替代方案,其通过从更丰富、异构的数据源中学习可复用的地点表征来实现建模。本文在巴西、尼日利亚和美国开展基准测试,将人口动力学基础模型(PDFM)嵌入与标准化地理空间协变量用于次国家级人口估计。在地理结构化验证下,PDFM使预测拟合度中未解释方差的中位数降低20.1%(四分位距:10.0–33.2%,涵盖各国-模型对比),Kullback-Leibler散度降低23.2%(9.2–26.2%)。然而,这些改进呈现不均衡性:PDFM在地理空间协变量对聚居背景刻画较弱的区域(如面积较大且欠发达的次国家级区域)优势最为显著;此外,PDFM性能与空间尺度耦合紧密,其嵌入在不同空间聚合层级间的迁移灵活性低于传统地理空间协变量。结果表明,地理空间基础模型对地点的表征可在数据匮乏场景下提升人口估计精度,但当存在空间尺度错配时,其效益将出现可预测的衰减,揭示了当前地理空间人工智能的一项根本性局限。