Key points are not available for this paper at this time.
階層テキスト分類は、各文書をラベルタクソノミー内のクラスのセットに分類することを目的としています。以前のほとんどの研究は、膨大な人間のアノテーションデータを必要とする完全または半監督方式に焦点を当てていますが、これは取得にコストと時間がかかります。人間の労力を軽減するために、本論文では最小限の監督で階層テキスト分類に取り組みます:各ノードのクラス名のみを唯一の監督として使用します。最近、大規模言語モデル(LLM)は、ゼロショットプロンプティングを通じてさまざまなタスクで競争力のあるパフォーマンスを示していますが、この方法は階層設定でうまく機能しません。なぜなら、プロンプトに大きく構造化されたラベル空間を含めることが非効果的だからです。一方、以前の弱い監督による階層テキスト分類法は、生のタクソノミーのスケルトンのみを利用し、テキストコーパスに隠された豊かな情報を無視しています。これらの情報は追加のクラス指示特徴として機能する可能性があります。これらの課題に取り組むために、我々はTELEClass、タクソノミーの強化とLLM強化の弱い監督による階層テキスト分類を提案します。それは(1) コーパスから採掘したクラス指示トピック用語でラベルタクソノミーを自動的に強化し、分類器のトレーニングを促進し、(2) 階層ラベル空間に合わせてデータのアノテーションと作成にLLMを利用します。実験により、TELEClassは以前の弱い監督による階層テキスト分類手法やLLMベースのゼロショットプロンプティング手法を、2つの公開データセットで上回ることができることが示されました。
Zhang et al. (木曜日、) はこの問題を研究しました。