이 논문은 설명 가능한 AI에서 사용되는 특성 귀속 기술에 대한 최첨단 조사를 제시합니다. 우리는 기존 문헌을 모델에 구애받지 않는 방법과 모델에 특정한 접근 방식의 제안된 분류 체계로 정리합니다. 이러한 방법의 형식적 정의, 수학적 공식화, 사용 맥락, 강점 및 한계를 분석합니다. 비교 분석은 모델 불가지론, 설명 형식, 계산 비용 및 모델에 대한 충실도와 관련된 주요 트레이드 오프를 강조합니다. 우리는 모델에 구애받지 않는 기술이 모델을 오라클로 취급하여 넓은 적용 가능성을 제공하는 동시에 더 높은 계산 비용이 발생할 수 있으며, 모델 특정 방법이 내부 모델 아키텍처나 기울기를 활용하여 보다 효율적이고 충실한 설명을 제공할 수 있음을 발견했습니다. 그러나 이는 일반성이 감소하는 결과를 초래합니다.
Saidjon Kamolov (화요일)은 이 질문을 연구했습니다.