저자 귀속은 사이버 보안에서 중요한 도구로 간주되며, 주로 익명의 텍스트 뒤에 있는 악성 행위를 식별하는 데 사용됩니다. 사이버 위협 정보 및 디지털 포렌식에서 피싱 이메일, 암거래 포럼 게시물, 익명 문서 및 위협 메시지와 같은 텍스트 콘텐츠를 원저자로 귀속하는 것은 여전히 도전 과제가 됩니다. 이 문제는 아랍어에서 특히 분명한데, 이는 풍부한 형태학, 높은 스타일 변동성 및 실제 시나리오에서 짧고 잡음이 많은 텍스트의 발생 때문입니다. 이 논문은 문서 수준과 문장 수준 분석을 통합하여 분류 성능을 향상시키는 아랍어 저자 귀속을 위한 이중 수준 감독 학습 접근 방식을 제안합니다. 초기 학습 단계에서는 문서를 이진 스타일로 매트릭스 기능을 사용하여 표현하고, 확률적 경량 감소법(SGD)으로 최적화된 선형 로지스틱 회귀 모델을 사용하여 분류합니다. 문서 기반 확률 표시 절차(DPIP)가 도입되어 중요한 문서와 비중요 문서를 클래스 확률 정보를 사용하여 구분합니다. 비중요 문서는 마지막 학습 단계에서 처리됩니다. 저자별로 가장 차별화된 문장을 선택하는 문장 기반 유도 절차(SEP)를 사용하여 정제된 문장 수준 데이터 세트를 구축합니다. 그런 다음 문장 수준 분류기를 학습하고 적용합니다. 최종 문서 레이블은 문장 기반 다수결 절차(SMP)를 사용하여 결정됩니다. 제안된 접근 방식은 여러 주제에서 10명의 저자의 텍스트로 구성된 기준 아랍어 데이터 세트에서 평가되었습니다. 실험 결과는 제안된 접근 방식이 99.28%의 전체 정확도를 달성하여 여러 최신 기술 접근 방식을 초월함을 보여줍니다. 더욱이, 최종 수준 단계는 비중요 문서의 분류 성능을 59.51%에서 71.17%로 유의미하게 향상시킵니다. 이러한 결과는 짧고 다주제 문서를 포함한 아랍어 문서의 저자를 정확하게 식별하는 데 있어 제안된 접근 방식의 효과를 확인합니다.
Aldebei 등(목요일)은 이 문제를 연구했습니다.