传统的遥感图像智能解译技术大多建立在封闭集假设之上,高度依赖海量的人工标注数据,且在推理阶段仅能识别训练集中预先定义的固定类别。面对真实地球观测场景中复杂多变的地表环境、尺度剧烈变化的目标以及长尾分布的罕见地物,传统范式泛化能力受限,难以满足高度动态的开放世界解译需求。近年来,得益于视觉—语言基础模型的快速发展,开放词汇感知技术应运而生。该技术通过跨模态语义对齐打破了传统离散标签的束缚,在零样本与少样本场景下展现出强大的泛化潜力。然而,遥感影像独特的俯视成像视角、复杂的拓扑关联以及多源异构的物理模态,致使自然图像领域的通用大模型在向遥感垂直领域迁移时面临显著的领域鸿沟。为此,本文系统梳理并总结了遥感图像开放词汇感知领域的最新研究进展。首先,从数据和方法两个维度,阐述了遥感视觉—语言预训练数据集的构建策略,以及预训练架构从基础域适配向异构数据感知与地理先验增强的演进脉络;其次,全面剖析了开放词汇感知在零样本场景分类、跨模态检索、图像分割、目标检测与定位、变化检测以及三维点云理解等关键下游任务中的应用范式;最后,深入探讨了当前该领域在高质量训练数据匮乏、细粒度评测基准缺失、多源异构模态深层对齐不足及模型可靠性等方面面临的核心挑战,并从多模态大语言模型驱动的生成式感知、全模态基础模型演进、时空因果推演及星地协同计算等方向对未来发展趋势进行了系统展望,以期为推动遥感智能解译迈向真实开放世界提供详实的理论参考。
Kaiyu et al. (Thu,) studied this question.