Key points are not available for this paper at this time.
백도어 공격은 일반적으로 훈련 데이터를 오염시켜 트리거가 테스트 단계에서 미리 정해진 해로운 효과를 활성화할 수 있도록 실행됩니다. 본 연구에서는 텍스트 모달리티에 백도어를 주입하는 테스트 시간 백도어 공격인 AnyDoor를 제시합니다. 이는 적대적 테스트 이미지를 사용하여 수행되며(같은 보편적 섭동을 공유), 훈련 데이터에 대한 접근 또는 수정 없이 이루어집니다. AnyDoor는 보편적 적대적 공격에서 사용되는 유사한 기술을 활용하지만, 해로운 효과의 설정과 활성화 타이밍을 분리할 수 있는 점에서 차별화됩니다. 우리의 실험에서는 AnyDoor의 효과성을 LLaVA-1.5, MiniGPT-4, InstructBLIP, BLIP-2와 같은 인기 있는 MLLM에 대해 검증하고, 포괄적인 소거 연구를 제공합니다. 주목할 만한 것은 백도어가 보편적 섭동에 의해 주입되기 때문에 AnyDoor는 백도어 트리거 프롬프트/해로운 효과를 동적으로 변경할 수 있어 백도어 공격 방어에 새로운 도전을 제기합니다. 우리의 프로젝트 페이지는 https://sail-sg.github.io/AnyDoor/에서 확인할 수 있습니다.
Lu 외(2024)는 이 질문을 연구했습니다.