Key points are not available for this paper at this time.
In der heutigen Zeit ist das Vortrainieren großer Modelle auf großangelegten Datensätzen ein entscheidendes Thema im Deep Learning geworden. Die vortrainierten Modelle mit hoher Repräsentationsfähigkeit und Übertragbarkeit erzielen große Erfolge und dominieren viele downstream Aufgaben in der Verarbeitung natürlicher Sprache und der 2D-Visuelle. Es ist jedoch nicht trivial, ein solches Vortrainings-Fine-Tuning-Paradigma auf die 3D-Visuelle zu übertragen, angesichts der begrenzten Trainingsdaten, die relativ unbequem zu sammeln sind. In diesem Paper bieten wir eine neue Perspektive zur Nutzung von vortrainiertem 2D-Wissen im 3D-Bereich, um dieses Problem anzugehen, indem wir vortrainierte Bildmodelle mit dem neuartigen Point-to-Pixel-Prompting für die Punktwolkenanalyse zu geringen Parameterkosten einstellen. Nach dem Prinzip des Prompting-Engineerings transformieren wir Punktwolken in farbenfrohe Bilder mit geometrie-erhaltener Projektion und geometrie-bewusster Färbung, um uns an vortrainierte Bildmodelle anzupassen, deren Gewichte während der End-to-End-Optimierung der Aufgaben zur Punktwolkenanalyse eingefroren bleiben. Wir führen umfangreiche Experimente durch, um zu zeigen, dass die Zusammenarbeit mit unserem vorgeschlagenen Point-to-Pixel-Prompting ein besseres vortrainiertes Bildmodell zu einer durchweg besseren Leistung in der 3D-Visuelle führt. Unser Verfahren erreicht 89,3 % Genauigkeit im schwierigsten Setting von ScanObjectNN und übertrifft konventionelle Punktwolkenmodelle mit wesentlich weniger trainierbaren Parametern. Unser Framework zeigt auch eine sehr wettbewerbsfähige Leistung bei der Klassifikation von ModelNet und der Segmentierung von ShapeNet-Teilen. Der Code ist verfügbar unter https://github.com/wangzy22/P2P.
Wang et al. (Thu,) haben diese Frage untersucht.