Key points are not available for this paper at this time.
우리는 기계 학습 모델을 효율적으로 훈련할 수 있는 작은 대표 데이터 하위 집합을 선택하는 것을 목표로 하는 데이터 선택 문제를 연구합니다. k-평균 클러스터링과 민감도 샘플링에 기반한 새로운 데이터 선택 접근 방식을 제시합니다. 모델 손실이 H"older 연속적이라고 가정할 때, 우리의 접근법은 평균 손실이 전체 데이터셋의 평균 손실에 해당하는 ``전형적인'' k + 1/² 요소 집합을 선택할 수 있음을 증명합니다. 여기서 평균 손실은 곱셈적 (1) 계수와 덧셈적 ₖ까지 동등하며, ₖ는 입력 임베딩에 대한 k-평균 비용을 나타내고 H"older 상수입니다. 우리는 또한 기초 모델의 미세 조정에서 우리의 접근 방식의 성능과 확장성을 입증하며, 이것이 최신 방법보다 우수하다는 것을 보여줍니다. 또한 선형 회귀에 어떻게 적용될 수 있는지를 보여주어, 놀랍게도 레버리지 점수 샘플링의 성능과 일치하는 새로운 샘플링 전략을 제시하였습니다. 이는 개념적으로 더 간단하고 확장 가능성이 높습니다.
Axiotis et al. (Tue,)는 이 문제를 연구했습니다.