La segmentación de escena 3D de vocabulario abierto sirve como una capacidad fundamental de la percepción humana en la visión por computadora, ya que permite a los sistemas reconocer y segmentar objetos arbitrarios en entornos complejos. Sin embargo, los enfoques existentes a menudo tienen dificultades para generalizar a categorías no vistas y carecen de la capacidad para explotar conjuntamente la estructura geométrica y la información semántica. En este artículo, introducimos OV3DSeg-VGGT, un nuevo marco que construye un modelo de segmentación de escena 3D al combinar priors geométricos destilados del transformador visual preentrenado con conocimiento semántico. Nuestro método aprovecha la segmentación 2D temporalmente consistente y las incrustaciones multimodales de CLIP para construir representaciones robustas de instancias desde diferentes vistas. Al ajustar finamente el transformador de geometría visual con un objetivo de aprendizaje contrastivo e introducir un proyector de destilación guiado por CLIP, alineamos las características geométricas con los priors semánticos, permitiendo la segmentación con una fuerte generalización a categorías nuevas. Experimentos extensos muestran que OV3DSeg-VGGT supera los métodos de vanguardia existentes y logra generalización en la segmentación 3D de vocabulario abierto.
Zhou et al. (Sun,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: