대형 언어 모델(LLMs)은 빠르게 발전했지만 해로운 또는 허용되지 않은 출력을 유도하는 적대적 "탈옥" 공격에 여전히 취약합니다. 우리는 블랙박스 의미 적대적 프롬프트 변형 생성과 법적 토큰으로 이산화하는 컴팩트하고 규제된 임베딩 레벨 접미사 최적화를 결합한 세 단계의 하이브리드 탈옥 프레임워크인 AB-JB를 제안합니다. AB-JB는 우선 공격자 LLM을 사용하여 각 해로운 행동에 대해 다수의 의미적으로 다양한 적대적 변형을 생성하고, 판별자 LLM을 사용하여 이러한 변형에 점수를 매기고 필터링하여 고품질 후보 풀로 만듭니다. 그 후, 제한된 계산 예산 하에 유효한 적대적 토큰 접미사를 얻기 위해 ₂ 규제, 반복별 최근접 이웃 프로젝션, 엄격한 반복 한도를 갖춘 접미사 전용 임베딩 최적화를 수행합니다. 우리는 네 가지 적대적 벤치마크(AdvBench, HarmBench, JailbreakBench, Malicious-Instruct)에서 다섯 개의 인기 있는 7B-매개변수 모델(Llama2, Falcon, Vicuna, Mistral, MPT)에 대해 AB-JB를 평가합니다. 이러한 설정에서 AB-JB는 평균 93% 데이터셋 수준 공격 성공률(ASR-DS)을 달성했으며, 변형별 성공률(ASR-APV)은 평균 55.7%입니다. Malicious-Instruct에서는 거의 완전한 데이터셋 성공률(99% ASR-DS)을 관찰했으며, 이는 이 데이터셋의 변형을 생성할 때 공격자로 더 큰 상업적 모델(Gemini 2.5 Flash)을 사용한 데 기인합니다. 토큰 수준 그래디언트 공격, 프롬프트 수준 검색 및 소프트 프롬프트 방법과 비교할 때, 우리의 실험은 AB-JB가 공격 성공, 7B 규모 모델 간의 교차 모델 성능 및 계산 효율성 사이에서 실용적인 타협을 제공한다고 나타냅니다. 이는 판별자 주도의 변형 선택과 22회 반복 접미사 최적화 한도로 가능해졌습니다. 이러한 결과는 지속적인 정렬 격차를 강조하며, 적대적으로 정보가 제공된 방어를 유도합니다. 본 연구는 7B 오픈 가중치 모델에 한정되며 접미사 최적화 단계에 대해 화이트 박스 접근을 가정합니다.
Ahmad et al. (Mon,)은 이 질문을 연구했습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: