Key points are not available for this paper at this time.
머신 러닝은 데이터에서 정보를 분석하고 추출하는 데 중요한 기초가 되며, 종종 결측 값 문제에 직면하게 된다. 결측 값은 완전히 무작위 결측, 무작위 결측 또는 무작위가 아닌 결측과 같은 다양한 요인으로 인해 발생한다. 이러한 모든 문제는 데이터 수집 중 시스템 오작동 또는 데이터 전처리 중의 인적 오류로 인해 발생할 수 있다. 그럼에도 불구하고, 데이터 분석 전에 결측 값을 처리하는 것이 중요하다. 결측 값을 무시하거나 생략하면 편향되거나 잘못된 분석 결과를 초래할 수 있다. 문헌에서 결측 값을 처리하기 위한 여러 제안이 있었다. 본 논문에서는 결측 데이터에 대한 몇 가지 문헌을 종합하고 특히 머신 러닝 기술에 초점을 맞춘다. 또한 결측 값 보간 기술의 주요 특징, 성능, 한계 및 가장 적합한 데이터 유형을 강조하여 머신 러닝 접근법이 어떻게 작동하는지에 대한 통찰을 제공한다. 우리는 k 최근접 이웃 방법과 랜덤 숲 알고리즘에 기반한 반복 보간 방법(missForest)을 제안하고 평가한다. 평가 작업은 결측 비율이 5%에서 20%로 유도된 Iris 및 새로운 발전기 팬 데이터에서 수행된다. 우리는 missForest와 k 최근접 이웃 모두 결측 값을 성공적으로 처리할 수 있으며 향후 연구 방향에 대해 제시할 수 있음을 보여준다.
Emmanuel et al. (Wed,)는 이 질문을 연구했다.