Key points are not available for this paper at this time.
데이터베이스는 누락, 잘못된 값 또는 불일치하는 값과 같은 다양한 오류로 손상될 수 있습니다. 점점 더, 현대 데이터 분석 파이프라인은 머신 러닝을 포함하게 되며, 더러운 데이터의 영향은 디버깅하기 어려울 수 있습니다. 더러운 데이터는 종종 희소하며, 단순 샘플링 솔루션은 고차원 모델에 적합하지 않습니다. 우리는 데이터 정리를 통해 머신 러닝 모델을 학습시키기 위한 점진적 프레임워크인 ActiveClean을 제안합니다. 우리의 프레임워크는 분석가가 작은 배치의 데이터를 정리할 때 모델을 반복적으로 업데이트하며, 중요도 가중치 및 더러운 데이터 감지와 같은 여러 가지 최적화를 포함합니다. 우리는 이 프레임워크를 감싸는 시각적 인터페이스를 설계하였으며, 비디오 분류 문제와 주제 모델링 문제를 위해 ActiveClean을 시연합니다.
Krishnan et al. (Thu,)는 이 질문을 연구했습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: