تسود نماذج انتشار الكامن (LDMs) في توليد الصور عالية الجودة، ومع ذلك فإن دمج تعلم التمثيل مع النمذجة التوليدية لا يزال يمثل تحديًا. نقدم إطار عمل جديد لنمذجة الصور التوليدية يbridges ينقل هذا الفجوة بسلاسة عن طريق استغلال نموذج انتشار ليمثل بشكل مشترك الكامنة منخفضة المستوى للصور (من مشفر أوتوماتيكي متغير) والميزات الدلالية عالية المستوى (من مشفر شبه خاضع للتدريب مثل DINO). تعتمد نهج الانتشار الكامن-الدلالي لدينا على تعلم توليد أزواج صور-ميزات متماسكة من ضوضاء خالصة، مما يعزز بشكل كبير كل من جودة التوليد وكفاءة التدريب، كل ذلك مع الحاجة فقط إلى تعديلات طفيفة على بنى محولات الانتشار القياسية. من خلال القضاء على الحاجة إلى أهداف تقطير معقدة، يبسط تصميمنا الموحد التدريب ويفتح استراتيجية استنتاج قوية جديدة: توجيه التمثيل، الذي يستغل الدلالات المتعلمة لتوجيه وتحسين توليد الصور. عند تقييمها في كل من الإعدادات الشرطية وغير الشرطية، يوفر طريقتنا تحسينات كبيرة في جودة الصورة وسرعة تقارب التدريب، مما يضع توجهاً جديداً لنمذجة التوليد المعتمدة على التمثيل. صفحة المشروع والكود: https://representationdiffusion.github.io
درس كوزيليس وآخرون (2025) هذا السؤال.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: