Key points are not available for this paper at this time.
O notável sucesso dos modelos modernos de aprendizado de máquina em grandes conjuntos de dados frequentemente exige um tempo de treinamento extenso e consumo de recursos. Para economizar custos, uma linha de pesquisa prevalente, conhecida como seleção de lotes online, explora a seleção de subconjuntos informativos durante o processo de treinamento. Embora esforços recentes tenham alcançado avanços ao medir o impacto de cada amostra na generalização, sua dependência de modelos de referência adicionais limita inerentemente suas aplicações práticas, quando não existem modelos ideais disponíveis. Por outro lado, os métodos clássicos que não usam modelo de referência envolvem a pontuação e seleção de dados de forma independente e amostral, o que sacrifica a diversidade e induz à redundância. Para enfrentar esse dilema, propomos a Seleção de Lotes Diversificados (DivBS), que não utiliza modelo de referência e pode selecionar de forma eficiente amostras diversas e representativas. Especificamente, definimos um novo objetivo de seleção que mede a representatividade ortogonalizada em grupo para combater o problema de redundância dos critérios anteriores baseados em amostras, e fornecemos uma realização eficiente em termos de seleção e princípios. Experimentos extensivos em várias tarefas demonstram a significativa superioridade da DivBS no compromisso entre desempenho e aceleração. O código está disponível publicamente.
Hong et al. (Sex,) estudaram essa questão.