Key points are not available for this paper at this time.
Nous introduisons Cap3D, une approche automatique pour générer des textes descriptifs pour des objets 3D. Cette approche utilise des modèles préentraînés provenant de la génération de légendes d'images, de l'alignement image-texte et des LLM pour consolider les légendes de plusieurs vues d'un actif 3D, contournant complètement le processus long et coûteux d'annotation manuelle. Nous appliquons Cap3D au jeu de données 3D à grande échelle récemment introduit, Objaverse, résultant en 660k paires 3D-texte. Notre évaluation, réalisée à l'aide de 41k annotations humaines du même ensemble de données, démontre que Cap3D dépasse les descriptions rédigées par des humains en termes de qualité, de coût et de rapidité. Grâce à une ingénierie d'invite efficace, Cap3D rivalise avec la performance humaine dans la génération de descriptions géométriques sur 17k annotations collectées à partir de l'ensemble de données ABO. Enfin, nous peaufinons les modèles Text-to-3D sur Cap3D et les légendes humaines, et montrons que Cap3D surpasse; et nous évaluons les SOTA, y compris Point-E, Shape-E et DreamFusion.
Luo et al. (Mon,) ont étudié cette question.