LLM 에이전트는 지능형 시스템의 중심이 되고 있습니다. 그러나 이들의 배치는 심각한 안전 우려를 불러옵니다. 기존의 방어수단은 주로 "안전 점검"에 의존하며, 이는 유해한 사용자 입력이나 안전하지 않은 에이전트 행동이 초래하는 복잡한 의미적 위험을 포착하는 데 어려움을 겪고 있습니다. 이는 안전 점검과 실제 위험 사이에 상당한 의미적 격차를 만들어냅니다. 이 격차를 해소하기 위해, 우리는 ALRPHFS(계층적 빠른 \& 느린 추론을 통한 적대적으로 학습된 위험 패턴)라는 새로운 방어 프레임워크를 제안합니다. ALRPHFS는 두 가지 핵심 구성 요소로 구성되어 있습니다: (1) 일반화 가능하고 균형 잡힌 위험 패턴 라이브러리를 반복적으로 정제하는 오프라인 적대적 자기 학습 루프, 이는 기본 LLM을 재훈련하지 않고도 강력성을 크게 향상시키며, (2) 탐지 효과성과 계산 효율성을 균형 있게 유지하는 온라인 계층적 빠른 \& 느린 추론 엔진. 실험 결과, 우리의 접근법은 기존 기준선에 비해 우수한 전체 성능을 달성하며, 80%의 최고 수준 평균 정확도를 기록하고 다양한 에이전트와 작업에서 강한 일반화를 보여줍니다.
Xiang et al. (Sun,)은 이 질문을 연구했습니다.