Los puntos clave no están disponibles para este artículo en este momento.
A pesar de los avances sustanciales en los modelos de Preentrenamiento Visual-Lenguaje (VLP), su susceptibilidad a ataques adversariales representa un desafío significativo. El trabajo existente rara vez estudia la transferibilidad de ataques en modelos VLP, lo que resulta en una brecha de rendimiento sustancial con respecto a los ataques de caja blanca. Observamos que trabajos anteriores pasan por alto los mecanismos de interacción entre modalidades, que juegan un papel crucial en la comprensión de las complejidades de los modelos VLP. En respuesta, proponemos un nuevo ataque, llamado Ataque de Interacción Multimodal Colaborativa (CMI-Attack), aprovechando la interacción de modalidades a través de la guía de incrustación y el aumento de interacción. Específicamente, atacando el texto a nivel de incrustación mientras se preservan los semánticos, así como utilizando gradientes de imagen de interacción para mejorar las restricciones sobre las perturbaciones de textos e imágenes. Significativamente, en la tarea de recuperación de imagen-texto en el conjunto de datos Flickr30K, CMI-Attack aumenta las tasas de éxito de transferencia de ALBEF a TCL, CLIPₕ₈ₓ y CLIP₂₍₍ en un 8. 11%-16. 75% en comparación con los métodos de última generación. Además, CMI-Attack también demuestra un rendimiento superior en escenarios de generalización entre tareas. Nuestro trabajo aborda el ámbito poco explorado de los ataques de transferencia en modelos VLP, arrojando luz sobre la importancia de la interacción entre modalidades para una mayor robustez adversarial.
Fu et al. (Sat,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: