초록 명명된 개체 인식(NER)은 전통적으로 감독 학습과 주석 데이터에 의존하는 자연어 처리 작업입니다. 이러한 데이터를 획득하는 것은 의료, 법률 및 금융 분야와 같은 전문 분야에서 종종 도전 과제가 됩니다. 이러한 분야는 가용 데이터의 부족으로 인해 일반적으로 저자원 도메인으로 언급되며, 긴 꼬리 개체로 구성됩니다. 이를 해결하기 위해 원본 데이터셋에서 추가 교육 사례를 생성하기 위해 데이터 증강 기법이 점점 더 많이 사용되고 있습니다. 본 연구에서는 두 가지 널리 사용되는 NER 모델인 Bi-LSTM + CRF 및 BERT에 대해 두 가지 주요 텍스트 증강 기법인 언급 대체 및 맥락 단어 대체의 효과를 평가합니다. 저자원 도메인에서 세 개의 데이터셋에 대한 실험을 수행하고, 다양한 훈련 하위 집합 크기와 증강된 예제 수의 조합이 미치는 영향을 탐색합니다. 우리는 데이터 증강이 특히 작은 데이터셋에 유익하다는 것을 확증할 뿐만 아니라, 증강된 예제의 최적 수가 보편적으로 존재하지 않음을 입증하며, NER 실무자는 프로젝트에 맞게 다양한 수치를 실험해야 함을 보여줍니다.
Torres et al. (화요일,)은 이 문제를 연구했습니다.