Key points are not available for this paper at this time.
تُدرس أساسيات اللغة المرئية على نطاق واسع في أنظمة تسميات الصور العصبية الحديثة، التي تعتمد عادةً على إطار العمل الخاص بالمشفر-المفكك والذي يتكون من مكونين رئيسيين: شبكة عصبية تلافيفية (CNN) لاستخراج ميزات الصور وشبكة عصبية متكررة (RNN) لتوليد تسميات اللغة. لدراسة مدى قوة أساسيات اللغة ضد الاضطرابات العدائية في رؤية الآلات وإدراكها، نقترح خوارزمية Show-and-Fool، والتي تعتبر خوارزمية جديدة لصنع أمثلة عدائية في تسميات الصور العصبية. توفر الخوارزمية المقترحة طريقتين للتقييم، للتحقق مما إذا كان يمكن خداع أنظمة تسميات الصور العصبية لإنتاج بعض التسميات أو الكلمات الرئيسية المختارة عشوائيًا. تُظهر تجاربنا الواسعة أن خوارزميتنا قادرة على تصميم أمثلة عدائية متشابهة بصريًا مع تسميات أو كلمات رئيسية مستهدفه عشوائيًا، ويمكن جعل هذه الأمثلة العدائية تملك قدرة عالية على الانتقال إلى أنظمة تسميات الصور الأخرى. وبالتالي، يؤدي نهجنا إلى تداعيات جديدة بشأن قوة تسميات الصور العصبية ورؤى جديدة في أساسيات اللغة المرئية.
درس تشين وآخرون (الإثنين) هذا السؤال.