Key points are not available for this paper at this time.
因果関係を理解することは、強い理論を発展させ、実践を導くために社会科学研究にとって重要です。しかし、因果関係についての明示的な議論は、あいまいな因果言語のために社会科学文献においてしばしば欠けています。本論文では、フルテキストの社会科学論文から因果文を抽出するために微調整されたテキストマイニングモデルを紹介します。Cooperation Databank (CoDa) から手動で注釈付けされた529の因果文と529の非因果文のデータセットを構築し、モデルの訓練と評価を行いました。いくつかの事前訓練された言語モデル(BERT、SciBERT、RoBERTa、LLAMA、Mistral)がこのデータセットや一般目的の因果性データセットで微調整されました。モデルのパフォーマンスは、保持された社会科学および一般目的のテストセットで評価されました。結果は、限られたデータであっても社会科学データセットでトランスフォーマーモデルを微調整することが、一般目的データのみで微調整されたモデルと比較して、因果文抽出を大幅に改善することを示しました。結果は、学術的な執筆における因果言語を正確に捉えるためのドメイン特有の微調整とデータの重要性を示しています。この自動的な因果文抽出方法は、社会科学全体にわたる因果的主張の包括的で大規模な分析を可能にします。既存の因果文を体系的にカタログ化することによって、この研究は社会現象の背後にあるメカニズムを明らかにし、理論の発展を促し、分野の方法論的な厳密さを強化するためのさらなる研究の基盤を築きます。
ノルージーら(Wed)がこの問題を研究しました。