Key points are not available for this paper at this time.
データベースは、欠損、不正確、または矛盾した値などのさまざまなエラーによって破損する可能性があります。現代のデータ分析パイプラインはますます機械学習を含むようになり、汚れたデータの影響はデバッグが難しい場合があります。汚れたデータはしばしばスパースであり、素朴なサンプリングソリューションは高次元モデルには適していません。私たちは、データクレンジングを伴う機械学習モデルのトレーニングのためのプログレッシブフレームワーク「ActiveClean」を提案します。私たちのフレームワークは、アナリストが少量のデータをクリーンアップするたびにモデルを反復的に更新し、重要度重み付けや汚れたデータの検出などの多くの最適化を含みます。このフレームワークをラップする視覚インターフェースを設計し、ActiveCleanをビデオ分類問題とトピックモデリング問題に示します。
Krishnan et al. (Thu,) はこの問題を調査しました。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: