Key points are not available for this paper at this time.
Estudamos o problema de seleção de dados, cujo objetivo é selecionar um pequeno subconjunto representativo de dados que pode ser usado para treinar eficientemente um modelo de aprendizado de máquina. Apresentamos uma nova abordagem de seleção de dados baseada em agrupamento k-means e amostragem de sensibilidade. Assumindo acesso a uma representação de incorporação dos dados com respeito à qual a perda do modelo é H\"older contínua, nossa abordagem demonstravelmente permite selecionar um conjunto de elementos ``típicos'' k + 1/² cuja perda média corresponde à perda média de todo o conjunto de dados, até um fator multiplicativo (1) e um aditivo ₖ, onde ₖ representa o custo k-means para as incorporações de entrada e é a constante H\"older. Além disso, demonstramos o desempenho e a escalabilidade de nossa abordagem na adaptação fina de modelos fundamentais e mostramos que ela supera métodos de ponta. Também mostramos como pode ser aplicada em regressão linear, levando a uma nova estratégia de amostragem que curiosamente iguala o desempenho da amostragem de pontuação de alavancagem, enquanto é conceitualmente mais simples e escalável.
Axiotis et al. (Terça,) estudaram essa questão.