Los puntos clave no están disponibles para este artículo en este momento.
Entender las características regionales urbanas es fundamental para impulsar perspectivas críticas para la planificación y gestión urbana. Hemos sido testigos de la exitosa aplicación de Modelos Fundamentales (FMs) preentrenados en la generación de representaciones universales para varias tareas posteriores. Sin embargo, aplicar este principio al dominio geoespacial sigue siendo un desafío, principalmente debido a la dificultad de reunir datos extensos para desarrollar un modelo urbano fundamental dedicado. Aunque ha habido algunos intentos de potenciar los FMs existentes con datos urbanos, la mayoría de ellos se centran en FMs de modalidad única sin considerar la naturaleza multimodal de las tareas de comprensión de regiones urbanas. Para abordar esta brecha, introducimos ReFound - un marco novedoso para el Reentrenamiento de un modelo fundamental para la comprensión de regiones urbanas, aprovechando las fortalezas de ambos FMs lingüísticos y visuales. En este marco, primero inventamos un Transformador de Mezcla de Expertos Geoespaciales (MoGE), para integrar de manera efectiva la incrustación de datos geoespaciales multifuente. A partir de esto, ReFound se mejora mediante la destilación conjunta de conocimiento de FMs lingüísticos, visuales y de lenguaje-visual respectivamente, aumentando así sus capacidades de generalización. Mientras tanto, diseñamos un enfoque de modelado de datos geoespaciales enmascarados junto con un mecanismo de alineación espacial cruzada, para mejorar el conocimiento espacial de ReFound derivado de datos geoespaciales. Amplios experimentos realizados en seis conjuntos de datos del mundo real sobre tres tareas de comprensión de regiones urbanas demuestran el rendimiento superior de nuestro marco.
Xiao et al. (Sat,) estudiaron esta cuestión.