Key points are not available for this paper at this time.
最新で信頼できる大規模言語モデル(LLM)は常に求められています。通常、LLMは固定されたデータセットで訓練され、その後展開されます。しかし、訓練データは常に時代遅れになります。ウェブデータを使用したAIの自動訓練を可能にするには、バイアス、スパム、およびその他の安全でないまたは望ましくないテキストに関するデータの質と安全性についての重要な懸念があります。純粋なデータは信頼性のあるモデルを生成するために不可欠です。不純なデータでモデルを訓練すると望ましくない結果をもたらす可能性があります。この研究は、ウェブデータを収集し、既存の信頼できるAIモデルの助けを借りて不要なテキストを自動的にフィルタリングするシステムを提案します。実験では、小さなサンプルのウェブデータを収集しフィルタリングし、データの精製におけるシステムの有効性を示しました。
プラニース・ヴァドラパティ(木曜日)がこの問題を研究しました。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: