Key points are not available for this paper at this time.
Les modèles de Text-to-Image (T2I) ont connu des avancées significatives ces dernières années, mais ils ont encore du mal à capturer avec précision les détails complexes spécifiés dans des prompts de composition complexes. Bien que l'affinage des modèles T2I avec des objectifs de récompense ait montré des promesses, il souffre de "hacking de récompense" et peut ne pas bien se généraliser aux distributions de prompts non vues. Dans ce travail, nous proposons l'Optimisation du Bruit basée sur la Récompense (ReNO), une approche novatrice qui améliore les modèles T2I lors de l'inférence en optimisant le bruit initial en fonction du signal provenant d'un ou plusieurs modèles de récompense de préférence humaine. Remarkablement, résoudre ce problème d'optimisation par ascension de gradient pendant 50 itérations produit des résultats impressionnants sur quatre modèles différents à une étape sur deux benchmarks compétitifs, T2I-CompBench et GenEval. Dans une limite de budget computationnel de 20 à 50 secondes, les modèles améliorés par ReNO surpassent systématiquement les performances de tous les modèles Text-to-Image open-source actuels. D'importantes études utilisateurs démontrent que notre modèle est préféré presque deux fois plus souvent comparé au modèle populaire SDXL et est au même niveau que le Stable Diffusion 3 propriétaire avec 8B paramètres. De plus, avec les mêmes ressources computationnelles, un modèle à une étape optimisé par ReNO surpasse des modèles open-source largement utilisés tels que SDXL et PixArt-, soulignant l'efficacité et l'efficacité de ReNO pour améliorer les performances des modèles T2I au moment de l'inférence. Le code est disponible sur https://github.com/ExplainableML/ReNO.
Eyring et al. (2024) ont étudié cette question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: