Key points are not available for this paper at this time.
Dans cet article, nous montrons différentes méthodes d'ajustement fin pour Stable Diffusion XL ; cela inclut des étapes d'inférence et une personnalisation des légendes pour chaque image afin de s'aligner avec la génération d'images dans le style d'un ensemble d'entraînement commercial d'icônes 2D. Nous montrons également à quel point il est important de définir correctement ce que l'on entend par "haute qualité", en particulier pour un environnement d'utilisation commerciale. Alors que les modèles d'IA générative continuent de gagner une large acceptation et utilisation, de nombreuses façons différentes d'optimiser et d'évaluer ces modèles émergent pour diverses applications. Spécifiquement, les modèles de conversion de texte en image, tels que Stable Diffusion XL et DALL-E 3, nécessitent des pratiques d'évaluation distinctes pour générer efficacement des icônes de haute qualité selon un style spécifique. Bien que certaines images générées sur la base d'un certain style puissent avoir un score FID plus bas (meilleur), nous montrons que cela n'est pas absolu en soi, même pour des icônes rasterisées. Alors que les scores FID reflètent la similarité des images générées par rapport à l'ensemble d'entraînement global, les scores CLIP mesurent l'alignement entre les images générées et leurs descriptions textuelles. Nous montrons comment les scores FID omettent des aspects significatifs, tels que la minorité de différences de pixels qui comptent le plus dans une icône, tandis que les scores CLIP entraînent une mauvaise évaluation de la qualité des icônes. La compréhension de "similarité" par le modèle CLIP est façonnée par ses propres données d'entraînement ; ce qui ne prend pas en compte la variation des caractéristiques dans notre style de choix. Nos résultats soulignent le besoin de métriques d'évaluation spécialisées et d'approches d'ajustement fin lors de la génération d'icônes commerciales de haute qualité, menant potentiellement à des applications plus efficaces et adaptées des modèles de texte en image dans des contextes de design professionnel.
Sultan et al. (Jeu,) ont étudié cette question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: