La localización visual 3D tiene como objetivo localizar objetos objetivo en nubes de puntos basándose en lenguaje natural de forma libre, que a menudo describe tanto los objetos objetivo como los de referencia. La alineación efectiva entre características visuales y textuales es crucial para esta tarea. Sin embargo, los métodos existentes de dos etapas que dependen únicamente de características a nivel de objeto pueden ofrecer una precisión subóptima, mientras que los métodos de una etapa que solo alinean características a nivel de punto pueden ser propensos al ruido. En este trabajo, proponemos DDPA-3DVG, un nuevo marco que alinea progresivamente ubicaciones visuales y descripciones lingüísticas en múltiples granularidades. Específicamente, desacoplamos las descripciones en lenguaje natural en representaciones distintas de objetos objetivo, objetos de referencia y sus relaciones mutuas, mientras desenredamos escenas 3D en características a nivel de objeto, a nivel de voxel y a nivel de punto. Al fusionar progresivamente estas características duales desacopladas de grueso a fino, nuestro método mejora la alineación cruzada modal y logra un rendimiento de vanguardia en tres puntos de referencia desafiantes: ScanRefer, Nr3D y Sr3D. El código se publicará en https://github.com/HDU-VRLab/DDPA-3DVG.
Gu et al. (Mon,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: