Key points are not available for this paper at this time.
데이터 증강은 컴퓨터 비전 작업에서 딥 러닝 방법의 정확도를 향상시키는 중요한 기법이지만, 자연어 작업에서의 연구는 여전히 매우 제한적입니다. 본 논문에서는 신경 기계 번역을 위한 새로운 데이터 증강 방법을 제시합니다. 이전의 증강 방법들이 문장에서 단어를 무작위로 삭제, 교환 또는 다른 단어로 대체하는 것과는 달리, 우리는 문장에서 무작위로 선택된 단어를 그와 관련된 여러 단어의 맥락 혼합으로 부드럽게 증강합니다. 보다 정확하게, 우리는 단어의 원-핫 표현을 어휘에 대한 분포(언어 모델에서 제공됨)로 대체하며, 즉 이 단어의 임베딩을 의미상 유사한 여러 단어의 가중 조합으로 대체합니다. 이러한 단어들의 가중치는 대체될 단어의 맥락 정보에 의존하므로, 새로 생성된 문장은 이전의 증강 방법보다 훨씬 더 풍부한 정보를 캡처합니다. 소규모 및 대규모 기계 번역 데이터셋에서의 실험 결과는 우리의 방법이 강력한 기준선에 비해 우수하다는 것을 보여줍니다.
Zhu et al. (Sat,)이 이 질문을 연구했습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: