Key points are not available for this paper at this time.
نقدم طريقة للتلاعب بالمظهر المعتمد على النصوص بدون تدريب مسبق في الصور والفيديوهات الطبيعية. استنادًا إلى صورة أو فيديو مدخل ونص مستهدف، هدفنا هو تعديل مظهر الكائنات الموجودة (مثل نسيج الكائن) أو تعزيز المشهد بتأثيرات بصرية (مثل الدخان، النار) بطريقة ذات معنى دلالي. نقوم بتدريب مولد باستخدام مجموعة بيانات داخلية من أمثلة التدريب، مقتبسة من مدخل واحد (صورة أو فيديو ونص مستهدف)، مع الاستفادة من نموذج CLIP المدرب مسبقًا لتحديد خسائرنا. بدلاً من توليد الناتج المعدل مباشرة، فكرتنا الرئيسية هي توليد طبقة تعديل (لون + شفافية) يتم دمجها فوق المدخل الأصلي. يتيح لنا ذلك تقييد عملية التوليد والحفاظ على دقة عالية بالنسبة للمدخل الأصلي من خلال خسائر جديدة مدفوعة بالنصوص التي تُطبق مباشرةً على طبقة التعديل. طريقتنا لا تعتمد على مولد مدرب مسبقًا ولا تتطلب أقنعة تعديل مقدمة من المستخدم. نظهر تعديلات دلالية محلية على صور وفيديوهات طبيعية عالية الدقة عبر مجموعة متنوعة من الكائنات والمشاهد.
درس بار تال وزملاؤه (الثلاثاء) هذا السؤال.