Key points are not available for this paper at this time.
大規模な未ラベルコーパスで訓練された連続単語表現は、多くの自然言語処理タスクに有用です。そのような表現を学習する人気のあるモデルは、各単語に異なるベクトルを割り当てることによって、単語の形態を無視します。これは、語彙が大きく、珍しい単語が多い言語にとっては制限となります。本論文では、各単語を文字n-グラムのバグとして表現するスキップグラムモデルに基づいた新しいアプローチを提案します。各文字n-グラムにベクトル表現が関連付けられ、単語はこれらの表現の合計として表されます。私たちの方法は高速で、大規模コーパスでモデルを迅速に訓練でき、訓練データに現れなかった単語の表現も計算可能です。私たちは、単語の類似性と類推タスクの両方において、9つの異なる言語で単語表現を評価しました。最近提案された形態的単語表現と比較することで、私たちのベクトルがこれらのタスクで最先端の性能を達成することを示しています。
Bojanowski et al. (Fri,) はこの問題を研究しました。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: